Poradnik

Ollama na VPS: uruchom własny model AI

Małe modele (3–8B w 4-bit) działają na VPS bez GPU z 8–16 GB RAM – powoli, ale za grosze. Do czatu, który odpowiada od razu, albo do czegokolwiek powyżej ~14B wynajmij raczej GPU na godziny.

Tylko CPU: czego się spodziewać

Na nowoczesnym VPS z 4–8 vCPU model 3B odpowiada w wygodnym tempie czytania, a model 8B nadaje się do zadań w tle – streszczeń, klasyfikacji, automatyzacji w n8n. Modele mixture-of-experts dobrze tu pasują, bo na każdy token pracuje tylko ich mała część.

Kiedy GPU się opłaca

Interaktywny czat dla kilku osób, modele od 14B w górę, długie dokumenty albo generowanie obrazów. Jedna karta 24 GB pokrywa większość z tego; dokładną liczbę sprawdzisz w kalkulatorze VRAM.

Instalacja

Zainstaluj Ollamę jednolinijkowym skryptem, pobierz model i – jeśli chcesz interfejs jak w ChatGPT – postaw przed nim Open WebUI. Nie otwieraj portu Ollamy na internet; łącz się przez interfejs webowy albo VPN.

Serwery VPS

Możemy otrzymać prowizję, gdy kupisz coś przez linki na tej stronie. Nie zmienia to ceny, którą płacisz, ani kolejności na liście.

Najlepsza cena
OVHcloud
VPS-1
  • 2 vCPU
  • 4 GB RAM
  • 40 GB NVMe
od4,54 USD/mies.≈ 17,45 zł
Zobacz plan →

Cena sprawdzona 28 września 2026

IONOS
VPS M+
  • 2 vCPU
  • 4 GB RAM
  • 120 GB NVMe
od5,00 USD/mies.≈ 19,22 zł
Zobacz plan →

Cena sprawdzona 28 września 2026 · Odnowienie: 14,00 USD/mies.

Contabo
Cloud VPS 4
  • 4 vCPU
  • 8 GB RAM
  • 100 GB SSD
od6,26 USD/mies.≈ 24,06 zł
Zobacz plan →

Cena sprawdzona 28 września 2026

Najczęstsze pytania

Od jakiego modelu zacząć?

Dobrym pierwszym testem jest model 7–8B w 4-bit, np. Llama 3.1 8B lub Qwen3 8B: mieści się w 8 GB i radzi sobie z większością codziennych zadań.

Czy moje dane są prywatne z Ollamą?

Tak – wszystko działa na Twoim serwerze. Tylko nie wystawiaj publicznie portu API bez uwierzytelniania.

Zobacz też