AI și self-hosting

Cum rulezi modele AI locale cu Ollama

Actualizat 7/20/2026

Ollama este cel mai simplu mod de a rula modele AI (LLM) pe serverul tău. Datele rămân la tine, iar costul este fix, nu per token.

1. Instalare

curl -fsSL https://ollama.com/install.sh | sh

2. Descarcă și rulează un model

ollama run llama3.2

Prima rulare descarcă modelul; apoi poți discuta direct în terminal.

3. Folosește-l prin API

Ollama expune un API local pe portul 11434:

curl http://localhost:11434/api/generate -d '{
  "model": "llama3.2",
  "prompt": "Salut"
}'

4. Alege modelul potrivit

Modelele mici (1-3 miliarde de parametri) rulează pe CPU; cele mari au nevoie de GPU. Vezi cum alegi un model pentru hardware-ul tău.

Ai nevoie de un GPU?

Pentru modele mari și răspunsuri rapide, un server cu GPU face diferența. Vezi planurile GPU și când ai nevoie de un GPU. Adaugă o interfață de chat cu Open WebUI.

Pune ghidul în practică pe un VPS propriu

Servere cloud în UE, facturate la oră, gata în câteva minute, cu instalare cu un click pentru zeci de aplicații.

Vezi prețurile

Tutoriale similare