- 2 vCPU
- 4 GB RAM
- 40 GB NVMe
Prijs gecontroleerd op 28 september 2026
Kleine modellen (3–8B in 4-bit) draaien op een VPS met alleen CPU en 8–16 GB RAM — traag, maar voor een habbekrats. Wil je chat die direct aanvoelt, of iets boven ~14B, huur dan liever een GPU per uur.
Op een moderne VPS met 4–8 vCPU’s antwoordt een 3B-model in prettig leestempo, en een 8B-model is bruikbaar voor achtergrondtaken — samenvattingen, classificatie, n8n-automatiseringen. Mixture-of-experts-modellen passen goed, omdat per token maar een klein deel werkt.
Interactieve chat voor meerdere mensen, modellen vanaf 14B, lange documenten of beeldgeneratie. Eén kaart van 24 GB dekt het meeste; check het exacte getal in de VRAM-calculator.
Installeer Ollama met het installatiescript van één regel, download een model en zet Open WebUI ervoor als je een interface in ChatGPT-stijl wilt. Houd de Ollama-poort dicht voor internet en bereik hem via de web-UI of een VPN.
We kunnen een commissie ontvangen als je via links op deze pagina iets koopt. Dat verandert niets aan jouw prijs of aan de volgorde van de lijst.
Prijs gecontroleerd op 28 september 2026
Prijs gecontroleerd op 28 september 2026 · Verlenging: US$ 14,00/mnd
Prijs gecontroleerd op 28 september 2026
Een 4-bit-model van 7–8B zoals Llama 3.1 8B of Qwen3 8B is een goede eerste test: het past in 8 GB en kan de meeste dagelijkse taken aan.
Ja — alles draait op je eigen server. Zet de API-poort alleen niet openbaar online zonder authenticatie.