De cât VRAM ai nevoie pentru a rula LLM-uri local?

Întrebarea principală atunci când rulezi un LLM local este simplă: va încăpea în GPU-ul tău? Răspunsul depinde de dimensiunea modelului, cuantizare și lungimea contextului. Acest ghid îți oferă un punct de plecare practic pentru alegerea cantității potrivite de VRAM.

Cum afectează cuantizarea VRAM-ul

Cuantizarea reduce precizia folosită pentru stocarea ponderilor modelului. Cuantizarea pe biți mai puțini face modelul mai mic și folosește mai puțin VRAM, cu o anumită pierdere de calitate.

Cuantizare Biți per pondere Utilizare tipică
Q8_0 8 Calitate foarte ridicată
Q6_K ~6.6 Calitate foarte bună
Q5_K_M ~5.5 Calitate și dimensiune bune
Q4_K_M ~4.5 Echilibru bun între dimensiune și calitate
Q3_K_M ~3.5 VRAM mai puțin, pierdere mai mare de calitate

Q4_K_M este o alegere comună atunci când VRAM-ul este limitat. Dacă ai mai mult VRAM disponibil, Q5 sau Q6 îți permite să rulezi același model cu o cuantizare mai mică.

VRAM aproximativ în funcție de dimensiunea modelului

Acestea sunt estimări aproximative pentru ponderile modelului. Cantitatea reală de VRAM necesară este mai mare, deoarece runtime-ul, cache-ul KV și contextul folosesc de asemenea memorie.

Dimensiune model Q8_0 Q6_K Q4_K_M Q3_K_M
4B ~5 GB ~4 GB ~3 GB ~2.5 GB
8B ~9 GB ~7 GB ~5.5 GB ~4.5 GB
12B ~13 GB ~10 GB ~8 GB ~6.5 GB
14B ~16 GB ~12 GB ~9 GB ~7.5 GB
27B ~30 GB ~22 GB ~17 GB ~13 GB
32B ~36 GB ~27 GB ~20 GB ~16 GB
70B ~80 GB ~60 GB ~42 GB ~34 GB

Acestea sunt estimări, nu limite stricte. Arhitecturi diferite de modele și formate de cuantizare pot schimba dimensiunea reală.

Ce pot rula diferite cantități de VRAM

VRAM Interval practic Exemple actuale
8 GB Modele mici în jur de 4B până la 9B Gemma 4 E4B, Qwen3.5 9B
12 GB Modele mici până la medii în jur de 9B până la 14B Gemma 4 12B, Qwen3.5 9B
16 GB 12B până la 27B cu cuantizare mai mică Gemma 4 26B-A4B, Qwen3.6 27B la Q4
24 GB 27B până la 35B la Q4 până la Q6 Qwen3.8 27B, Gemma 4 31B
32 GB 27B până la 35B la cuantizare mai mare Qwen3.8 27B, Gemma 4 31B
48 GB Modele dense mari la cuantizare mai mică Modele din clasa 70B la Q3 până la Q4
80 GB Modele dense mari la cuantizare mai mare Modele din clasa 70B la Q4 până la Q6

Aceste intervale sunt pentru modelele ale căror ponderi pot încăpea pe GPU. Modelele MoE mari sunt diferite: doar o parte dintre parametrii lor sunt activi pentru fiecare token, dar modelul trebuie totuși să stocheze setul complet de ponderi. Un model cu 100B sau mai mulți parametri totali nu încape deci într-un buget de VRAM de dimensiunea 100B doar pentru că are mai puțini parametri activi.

Modele MoE

Modelele Mixture-of-Experts conțin mai multe grupuri de parametri numite experți. Doar unii experți sunt folosiți pentru fiecare token, ceea ce poate face inferența mai eficientă decât un model dens cu același număr total de parametri.

Cu toate acestea, experții inactivi fac încă parte din model. Modelele MoE mari pot necesita deci mult mai multă memorie decât sugerează numărul lor de parametri activi. Modelele foarte mari pot necesita mai multe GPU-uri sau descărcare în RAM-ul de sistem.

Lungimea contextului folosește de asemenea VRAM

Ponderile modelului sunt doar o parte din necesarul de memorie. Cache-ul KV crește pe măsură ce contextul devine mai lung, așa că rularea aceluiași model la context de 64K poate necesita substanțial mai mult VRAM decât rularea lui la 4K.

  • Contextul mai lung necesită mai mult VRAM.
  • Precizia cache-ului KV afectează utilizarea memoriei.
  • Dimensiunea batch-ului și utilizatorii concurenți cresc de asemenea utilizarea memoriei.
  • Lasă ceva VRAM disponibil pentru runtime în loc să umpli complet GPU-ul cu ponderile modelului.

Sfaturi practice

  • Verifică dimensiunea reală a modelului cuantizat pe care vrei să îl rulezi.
  • Nu folosi dimensiunea fișierului modelului drept cerință exactă de VRAM. Lasă loc pentru cache-ul KV și runtime.
  • Dacă un model nu încape în întregime în VRAM, o parte din el poate fi descărcată în RAM-ul de sistem, dar inferența va fi de obicei mai lentă.
  • Pentru workload-uri cu context lung sau agentice, alocă mai mult VRAM decât necesită doar ponderile modelului.
  • Mai multe GPU-uri pot împărți un model atunci când un singur GPU nu are suficient VRAM.

Rulează-l pe DaDesktop

Nu trebuie să cumperi un GPU pentru a rula un LLM local. DaDesktop îți oferă un desktop în cloud cu VRAM-ul de care ai nevoie, astfel încât să poți rula modelul direct fără să deții hardware-ul.

Alege nivelul de VRAM care se potrivește modelului tău, încarcă-l și începe să îl folosești. Fără setup, fără achiziție de hardware, fără probleme cu driverele. Vezi GPU-urile disponibile pentru opțiuni.