Koliko RAM-a i koji VPS
Model mora ceo da stane u RAM, uz memoriju koju troše sistem i druge aplikacije. Veličine u tabeli su približne, za podrazumevanu (kvantizovanu) verziju modela; tačnu veličinu vidite na stranici modela u Ollama biblioteci.
| Model | Parametri | Preuzimanje (približno) | VPS |
|---|---|---|---|
| llama3.2:3b | 3B | oko 2 GB | CLOUD 4 (8 GB), 3.390 RSD/mes |
| gemma3:4b | 4B | oko 3,3 GB | CLOUD 4 (8 GB), 3.390 RSD/mes |
| qwen2.5:7b | 7B | oko 4,7 GB | CLOUD 8 (16 GB), 6.890 RSD/mes |
| llama3.1:8b | 8B | oko 4,9 GB | CLOUD 8 (16 GB), 6.890 RSD/mes |
| gemma3:12b | 12B | oko 8 GB | CLOUD 8 (16 GB) najmanje, CLOUD 16 (32 GB) bolje |
| qwen2.5:14b | 14B | oko 9 GB | CLOUD 8 (16 GB) najmanje, CLOUD 16 (32 GB) bolje |
Za modele od 30B i više, treniranje i generisanje slika treba GPU, koji ne nudimo. Šta od AI projekata radi kod nas, a šta ne, piše na stranici AI hosting.
Instalacija i prvi model
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollama # servis "active (running)"
ollama pull qwen2.5:7b
ollama list
ollama run qwen2.5:7b "Objasni u dve rečenice šta je DNS."Skripta pravi systemd servis ollama i korisnika ollama. Modeli se čuvaju u /usr/share/ollama/.ollama/models. Model se učitava u memoriju pri prvom zahtevu i ostaje učitan nekoliko minuta posle poslednjeg.
Brzina na procesoru
Brzinu modela na našim VPS serverima još nismo objavili, jer bi bez izmerenih brojeva to bila procena. Na svom serveru je izmerite jednom komandom:
ollama run qwen2.5:7b --verbose
>>> Napiši tri rečenice o hostingu.
# ispod odgovora: "eval rate: ... tokens/s"eval rate je broj tokena (delova reči) koje model napiše u sekundi. Za chat u realnom vremenu poželjno je bar nekoliko tokena u sekundi; za poslove u pozadini (sažeci, razvrstavanje mejlova u n8n-u) i manja brzina je upotrebljiva. Jači VPS sa više jezgara daje bolji rezultat.
API i bezbedan pristup
Aplikacija na istom serveru poziva Ollamu direktno:
curl http://127.0.0.1:11434/api/generate -d '{
"model": "qwen2.5:7b",
"prompt": "Prevedi na engleski: Hvala na porudžbini.",
"stream": false
}'ssh -N -L 11434:127.0.0.1:11434 root@IP-adresa
# zatim lokalno: http://localhost:11434Open WebUI: razgovor iz pregledača
Open WebUI daje interfejs nalik ChatGPT-u, sa nalozima korisnika. Najjednostavnije je pokrenuti Ollamu i Open WebUI zajedno u Dockeru (instalacija Dockera: Docker na VPS-u). Ako ste Ollamu već instalirali skriptom, zaustavite taj servis (systemctl disable --now ollama) da se ne sukobe.
services:
ollama:
image: ollama/ollama
restart: unless-stopped
volumes:
- ollama:/root/.ollama
open-webui:
image: ghcr.io/open-webui/open-webui:main
restart: unless-stopped
environment:
- OLLAMA_BASE_URL=http://ollama:11434
ports:
- "127.0.0.1:3000:8080"
volumes:
- open-webui:/app/backend/data
volumes:
ollama:
open-webui:docker compose up -d
docker compose exec ollama ollama pull qwen2.5:7bOpen WebUI sluša na 127.0.0.1:3000. Za pristup preko domena sa SSL-om stavite ispred njega Caddy (reverse_proxy 127.0.0.1:3000 ili servis u istoj Compose mreži), kao u vodiču za n8n. Prvi nalog koji se registruje postaje administrator, pa ga napravite odmah posle pokretanja.
Povezivanje sa n8n-om
Ako n8n radi u istom docker-compose.yml kao Ollama, u n8n-u napravite Ollama pristupne podatke sa adresom http://ollama:11434 i koristite čvor „Ollama Chat Model“ u AI Agent ili Basic LLM Chain koracima. Postupak za n8n je u vodiču kako instalirati n8n na VPS.