Gids

Ollama op een VPS: draai je eigen AI-model

Kleine modellen (3–8B in 4-bit) draaien op een VPS met alleen CPU en 8–16 GB RAM — traag, maar voor een habbekrats. Wil je chat die direct aanvoelt, of iets boven ~14B, huur dan liever een GPU per uur.

Alleen CPU: wat je kunt verwachten

Op een moderne VPS met 4–8 vCPU’s antwoordt een 3B-model in prettig leestempo, en een 8B-model is bruikbaar voor achtergrondtaken — samenvattingen, classificatie, n8n-automatiseringen. Mixture-of-experts-modellen passen goed, omdat per token maar een klein deel werkt.

Wanneer een GPU het waard is

Interactieve chat voor meerdere mensen, modellen vanaf 14B, lange documenten of beeldgeneratie. Eén kaart van 24 GB dekt het meeste; check het exacte getal in de VRAM-calculator.

Installatie

Installeer Ollama met het installatiescript van één regel, download een model en zet Open WebUI ervoor als je een interface in ChatGPT-stijl wilt. Houd de Ollama-poort dicht voor internet en bereik hem via de web-UI of een VPN.

VPS hosting

We kunnen een commissie ontvangen als je via links op deze pagina iets koopt. Dat verandert niets aan jouw prijs of aan de volgorde van de lijst.

Beste prijs-kwaliteit
OVHcloud
VPS-1
  • 2 vCPU
  • 4 GB RAM
  • 40 GB NVMe
vanafUS$ 4,54/mnd≈ € 3,99
Bekijk pakket →

Prijs gecontroleerd op 28 september 2026

IONOS
VPS M+
  • 2 vCPU
  • 4 GB RAM
  • 120 GB NVMe
vanafUS$ 5,00/mnd≈ € 4,39
Bekijk pakket →

Prijs gecontroleerd op 28 september 2026 · Verlenging: US$ 14,00/mnd

Contabo
Cloud VPS 4
  • 4 vCPU
  • 8 GB RAM
  • 100 GB SSD
vanafUS$ 6,26/mnd≈ € 5,50
Bekijk pakket →

Prijs gecontroleerd op 28 september 2026

Veelgestelde vragen

Met welk model begin ik?

Een 4-bit-model van 7–8B zoals Llama 3.1 8B of Qwen3 8B is een goede eerste test: het past in 8 GB en kan de meeste dagelijkse taken aan.

Blijft mijn data privé met Ollama?

Ja — alles draait op je eigen server. Zet de API-poort alleen niet openbaar online zonder authenticatie.

Gerelateerd