Cum rulezi modele AI locale cu Ollama
Actualizat 7/20/2026
Ollama este cel mai simplu mod de a rula modele AI (LLM) pe serverul tău. Datele rămân la tine, iar costul este fix, nu per token.
1. Instalare
curl -fsSL https://ollama.com/install.sh | sh
2. Descarcă și rulează un model
ollama run llama3.2
Prima rulare descarcă modelul; apoi poți discuta direct în terminal.
3. Folosește-l prin API
Ollama expune un API local pe portul 11434:
curl http://localhost:11434/api/generate -d '{
"model": "llama3.2",
"prompt": "Salut"
}'
4. Alege modelul potrivit
Modelele mici (1-3 miliarde de parametri) rulează pe CPU; cele mari au nevoie de GPU. Vezi cum alegi un model pentru hardware-ul tău.
Ai nevoie de un GPU?
Pentru modele mari și răspunsuri rapide, un server cu GPU face diferența. Vezi planurile GPU și când ai nevoie de un GPU. Adaugă o interfață de chat cu Open WebUI.
Pune ghidul în practică pe un VPS propriu
Servere cloud în UE, facturate la oră, gata în câteva minute, cu instalare cu un click pentru zeci de aplicații.
Vezi prețurileTutoriale similare
Cum folosești OpenHands ca inginer software AI
OpenHands primește o sarcină și scrie, rulează și depanează codul singur. Iată cum îl folosești în siguranță.
Actualizat 7/20/2026AI și self-hostingCum extragi date de pe site-uri fără cod, cu Maxun
Construiește roboți care culeg date de pe site-uri prin click-uri, fără să scrii o linie de cod.
Actualizat 7/20/2026AI și self-hostingCum construiești un chatbot pentru clienți cu Dify
Folosește Dify ca să creezi un asistent care răspunde pe baza documentelor firmei tale, fără să scrii cod.
Actualizat 7/20/2026