- 2 vCPU
- 4 GB RAM
- 40 GB NVMe
Cena sprawdzona 28 września 2026
Małe modele (3–8B w 4-bit) działają na VPS bez GPU z 8–16 GB RAM – powoli, ale za grosze. Do czatu, który odpowiada od razu, albo do czegokolwiek powyżej ~14B wynajmij raczej GPU na godziny.
Na nowoczesnym VPS z 4–8 vCPU model 3B odpowiada w wygodnym tempie czytania, a model 8B nadaje się do zadań w tle – streszczeń, klasyfikacji, automatyzacji w n8n. Modele mixture-of-experts dobrze tu pasują, bo na każdy token pracuje tylko ich mała część.
Interaktywny czat dla kilku osób, modele od 14B w górę, długie dokumenty albo generowanie obrazów. Jedna karta 24 GB pokrywa większość z tego; dokładną liczbę sprawdzisz w kalkulatorze VRAM.
Zainstaluj Ollamę jednolinijkowym skryptem, pobierz model i – jeśli chcesz interfejs jak w ChatGPT – postaw przed nim Open WebUI. Nie otwieraj portu Ollamy na internet; łącz się przez interfejs webowy albo VPN.
Możemy otrzymać prowizję, gdy kupisz coś przez linki na tej stronie. Nie zmienia to ceny, którą płacisz, ani kolejności na liście.
Cena sprawdzona 28 września 2026
Cena sprawdzona 28 września 2026 · Odnowienie: 14,00 USD/mies.
Cena sprawdzona 28 września 2026
Dobrym pierwszym testem jest model 7–8B w 4-bit, np. Llama 3.1 8B lub Qwen3 8B: mieści się w 8 GB i radzi sobie z większością codziennych zadań.
Tak – wszystko działa na Twoim serwerze. Tylko nie wystawiaj publicznie portu API bez uwierzytelniania.