Preskoči na sadržaj
NovoPustili smo novi sajt sa mnogo novih opcija — AI Builder uskoro

Vodič · oko 30 minuta

Ollama na VPS serveru: instalacija, modeli i RAM

Ollama pokreće otvorene AI modele (Llama, Qwen, Gemma i druge) na vašem serveru. Na VPS-u bez grafičke kartice radi na procesoru: sporije, ali podaci ne napuštaju server i nema plaćanja po zahtevu.

Ubuntu 24.04Bez GPU-aAPI samo na 127.0.0.1
BRZI ODGOVOR

Može li Ollama da radi na VPS-u bez grafičke kartice?

Može. Ollama tada koristi procesor i RAM. Ollama navodi najmanje 8 GB RAM-a za modele od 7B i 16 GB za modele od 13B, pa je za modele od 7 do 8B pravi izbor VPS sa 16 GB (CLOUD 8, 6.890 RSD mesečno), a za modele do oko 4B CLOUD 4 sa 8 GB. Instalacija je jedna komanda, a model se preuzima sa ollama pull.

  • Brzinu na svom serveru merite sa ollama run model --verbose
  • API sluša na 127.0.0.1:11434; spolja samo preko SSH tunela ili HTTPS-a sa prijavom
  • GPU ne nudimo; za velike modele je bolji API

Ažurirano: · BeoHosting tim

Koliko RAM-a i koji VPS

Model mora ceo da stane u RAM, uz memoriju koju troše sistem i druge aplikacije. Veličine u tabeli su približne, za podrazumevanu (kvantizovanu) verziju modela; tačnu veličinu vidite na stranici modela u Ollama biblioteci.

Primeri modela, približna veličina i odgovarajući VPS
ModelParametriPreuzimanje (približno)VPS
llama3.2:3b3Boko 2 GBCLOUD 4 (8 GB), 3.390 RSD/mes
gemma3:4b4Boko 3,3 GBCLOUD 4 (8 GB), 3.390 RSD/mes
qwen2.5:7b7Boko 4,7 GBCLOUD 8 (16 GB), 6.890 RSD/mes
llama3.1:8b8Boko 4,9 GBCLOUD 8 (16 GB), 6.890 RSD/mes
gemma3:12b12Boko 8 GBCLOUD 8 (16 GB) najmanje, CLOUD 16 (32 GB) bolje
qwen2.5:14b14Boko 9 GBCLOUD 8 (16 GB) najmanje, CLOUD 16 (32 GB) bolje

Za modele od 30B i više, treniranje i generisanje slika treba GPU, koji ne nudimo. Šta od AI projekata radi kod nas, a šta ne, piše na stranici AI hosting.

Instalacija i prvi model

Ubuntu 24.04
curl -fsSL https://ollama.com/install.sh | sh
ollama --version
systemctl status ollama      # servis "active (running)"

ollama pull qwen2.5:7b
ollama list
ollama run qwen2.5:7b "Objasni u dve rečenice šta je DNS."

Skripta pravi systemd servis ollama i korisnika ollama. Modeli se čuvaju u /usr/share/ollama/.ollama/models. Model se učitava u memoriju pri prvom zahtevu i ostaje učitan nekoliko minuta posle poslednjeg.

Brzina na procesoru

Brzinu modela na našim VPS serverima još nismo objavili, jer bi bez izmerenih brojeva to bila procena. Na svom serveru je izmerite jednom komandom:

Merenje
ollama run qwen2.5:7b --verbose
>>> Napiši tri rečenice o hostingu.
# ispod odgovora: "eval rate: ... tokens/s"

eval rate je broj tokena (delova reči) koje model napiše u sekundi. Za chat u realnom vremenu poželjno je bar nekoliko tokena u sekundi; za poslove u pozadini (sažeci, razvrstavanje mejlova u n8n-u) i manja brzina je upotrebljiva. Jači VPS sa više jezgara daje bolji rezultat.

API i bezbedan pristup

Aplikacija na istom serveru poziva Ollamu direktno:

Poziv API-ja
curl http://127.0.0.1:11434/api/generate -d '{
  "model": "qwen2.5:7b",
  "prompt": "Prevedi na engleski: Hvala na porudžbini.",
  "stream": false
}'
SSH tunel sa vašeg računara
ssh -N -L 11434:127.0.0.1:11434 root@IP-adresa
# zatim lokalno: http://localhost:11434

Open WebUI: razgovor iz pregledača

Open WebUI daje interfejs nalik ChatGPT-u, sa nalozima korisnika. Najjednostavnije je pokrenuti Ollamu i Open WebUI zajedno u Dockeru (instalacija Dockera: Docker na VPS-u). Ako ste Ollamu već instalirali skriptom, zaustavite taj servis (systemctl disable --now ollama) da se ne sukobe.

docker-compose.yml
services:
  ollama:
    image: ollama/ollama
    restart: unless-stopped
    volumes:
      - ollama:/root/.ollama

  open-webui:
    image: ghcr.io/open-webui/open-webui:main
    restart: unless-stopped
    environment:
      - OLLAMA_BASE_URL=http://ollama:11434
    ports:
      - "127.0.0.1:3000:8080"
    volumes:
      - open-webui:/app/backend/data

volumes:
  ollama:
  open-webui:
Model u kontejneru
docker compose up -d
docker compose exec ollama ollama pull qwen2.5:7b

Open WebUI sluša na 127.0.0.1:3000. Za pristup preko domena sa SSL-om stavite ispred njega Caddy (reverse_proxy 127.0.0.1:3000 ili servis u istoj Compose mreži), kao u vodiču za n8n. Prvi nalog koji se registruje postaje administrator, pa ga napravite odmah posle pokretanja.

Povezivanje sa n8n-om

Ako n8n radi u istom docker-compose.yml kao Ollama, u n8n-u napravite Ollama pristupne podatke sa adresom http://ollama:11434 i koristite čvor „Ollama Chat Model“ u AI Agent ili Basic LLM Chain koracima. Postupak za n8n je u vodiču kako instalirati n8n na VPS.

Paketi i cene

VPS za Ollamu

VPS · root

CLOUD 4

Modeli do oko 4B parametara.

3.390 RSD mesečno

ili 37.290 RSD godišnje

vCPU
4
RAM
8 GB
Disk
80 GB NVMe
GPU
ne
Naruči CLOUD 4

Kartica, uplatnica ili PayPal · faktura za firme

PreporukaVPS · root

CLOUD 8

Modeli od 7 do 8B, Open WebUI i n8n.

6.890 RSD mesečno

ili 75.790 RSD godišnje

vCPU
8
RAM
16 GB
Disk
160 GB NVMe
GPU
ne
Naruči CLOUD 8

Kartica, uplatnica ili PayPal · faktura za firme

VPS · root

CLOUD 16

Modeli od 12 do 14B ili više modela.

13.990 RSD mesečno

ili 153.890 RSD godišnje

vCPU
16
RAM
32 GB
Disk
320 GB NVMe
GPU
ne
Naruči CLOUD 16

Kartica, uplatnica ili PayPal · faktura za firme

VPS je neupravljan; upravljanje se doplaćuje. Cene su konačne, BeoHosting nije u sistemu PDV-a.

Pitanja o Ollami

GPU, srpski jezik, disk i privatnost.

Da li Ollama radi bez grafičke kartice?

Radi. Bez GPU-a Ollama koristi procesor i RAM. Manji kvantizovani modeli (do oko 8B parametara) su upotrebljivi za kraće odgovore, sažetke i razvrstavanje teksta, ali su sporiji nego na GPU-u. Naši VPS serveri nemaju grafičke kartice.

Koji model izabrati za srpski jezik?

Višejezični modeli, na primer Qwen, Gemma i Llama, razumeju srpski, ali je kvalitet na manjim modelima slabiji nego na engleskom. Isprobajte dva ili tri modela na svojim stvarnim primerima pre nego što izaberete jedan. Ako je kvalitet srpskog presudan, API velikih modela (OpenAI, Anthropic, Google) daje bolji rezultat.

Koliko diska treba?

Model od 7 do 8B parametara zauzima oko 4,5 do 5 GB, a od 12 do 14B oko 8 do 9 GB. Ostavite mesta za dva do tri modela i sistem. CLOUD 8 ima 160 GB, što je dovoljno za više modela.

Da li podaci ostaju na mom serveru?

Da. Ollama izvršava model lokalno; pitanja i odgovori ne idu spoljnom servisu. Iz interneta se preuzima samo model, pri komandi ollama pull. Zato je Ollama dobar izbor kad podaci ne smeju da napuste vaš server.

Kada je bolji API nego sopstveni model?

Kad vam trebaju veliki model, brz odgovor, dobar srpski ili rad sa dugim dokumentima. Sopstveni model na procesoru ima smisla za manje zadatke, kad podaci moraju da ostanu kod vas ili kad je broj zahteva toliko veliki da API postaje skuplji od servera.