Alat AI gratis

Kalkulator VRAM: berapa memori GPU yang dibutuhkan modelmu?

Pilih model, kuantisasi, dan panjang konteks. Kalkulator menjumlahkan bobot model, KV cache, dan overhead runtime, lalu menunjukkan GPU mana yang bisa menjalankannya dan tempat termurah untuk menyewanya.

Total memori yang dibutuhkan
6,5 GB
Bobot model4,5 GB
KV cache1 GB
Overhead runtime1 GB

GPU yang bisa menjalankannya

  • 1× L424 GB VRAM · Vast.ai · Sebulan 24/7: US$241Paling worth itUS$0,33/jam →
  • 1× RTX A600048 GB VRAM · RunPod · Sebulan 24/7: US$241US$0,33/jam →
  • 1× RTX 409024 GB VRAM · Novita AI · Sebulan 24/7: US$245US$0,34/jam →
  • 1× RTX 4000 Ada20 GB VRAM · Akamai Cloud (Linode) · Sebulan 24/7: US$380US$0,52/jam →
  • 1× RTX 509032 GB VRAM · Vast.ai · Sebulan 24/7: US$438US$0,60/jam →
  • 1× L40S48 GB VRAM · RunPod · Sebulan 24/7: US$577US$0,79/jam →

Tanpa GPU

VPS tanpa GPU butuh sekitar 8 GB RAM untuk ini. Bisa jalan, tapi jawabannya lambat untuk model di atas ~8B parameter.

Paket VPS termurah dengan RAM yang cukup

Bobot = parameter × bit per bobot. KV cache dihitung dari jumlah layer, head, dan ukuran jendela model itu sendiri. Kami menambah 1 GiB untuk runtime dan menyisakan 5% tiap kartu.

Apa saja yang memakai memori

Ada tiga: bobot model (parameter × bit per bobot), KV cache yang bertambah dengan setiap token konteks dan setiap pengguna paralel, serta overhead tetap untuk runtime.

Angka arsitektur diambil dari file konfigurasi resmi tiap model, jadi model sliding-window seperti Gemma 3 dan gpt-oss dihitung dengan benar, bukan dilebih-lebihkan.

Memilih kuantisasi

4-bit (Q4_K_M) adalah pilihan default yang populer: sekitar seperempat memori FP16 dengan penurunan kualitas kecil. 8-bit hampir sama dengan aslinya. Pakai FP16 hanya untuk fine-tuning atau kalau memori tidak jadi masalah.

Pertanyaan yang sering diajukan

Berapa VRAM untuk model 8B?

Sekitar 6 GB pada 4-bit dengan konteks pendek, atau sekitar 17 GB pada FP16. Kartu 12–16 GB menanganinya dengan lega.

Kenapa konteks panjang memakan banyak memori?

KV cache menyimpan key dan value untuk setiap token di jendela konteks, di setiap layer. Menggandakan konteks berarti menggandakan bagian itu.

Apakah berlaku untuk Ollama?

Ya — Ollama memakai llama.cpp dengan file GGUF, persis seperti yang dijelaskan pilihan kuantisasi di sini.

Sumber

Harga diambil dari halaman harga resmi tiap penyedia pada tanggal yang tertera. Penyedia sering mengubah harga — yang berlaku adalah harga di halaman checkout.

Terkait