Mikä GPU paikallisille LLM:ille?
VRAM-tarve malleittain paikalliseen LLM-päättelyyn (Q4- ja Q8-kvantisointi) sekä peli-VRAM tarkkuuksittain — samasta rekisteristä kuin suunnittelija.
VRAM per malli
Kuinka paljon GPU-muistia kukin malli tarvitsee, 8k-kontekstilla. Suuremmat kontekstit lisäävät ~0,05 GB per 1k tokenia.
| Malli | Q4 (4-bittinen) | Q8 (8-bittinen) |
|---|---|---|
| Mistral 7B | 8 GB VRAM | 12 GB VRAM |
| Llama 3.1 8B | 8 GB VRAM | 12 GB VRAM |
| Qwen 2.5 7B | 8 GB VRAM | 12 GB VRAM |
| Phi-4 14B | 12 GB VRAM | 20 GB VRAM |
| Qwen 2.5 14B | 12 GB VRAM | 20 GB VRAM |
| Codestral 22B | 20 GB VRAM | 32 GB VRAM |
| Qwen 2.5 32B | 24 GB VRAM | 40 GB VRAM |
| Llama 3.1 70B | 80 GB VRAM | 80 GB VRAM |
| Qwen 2.5 72B | 80 GB VRAM | 96 GB VRAM |
| DeepSeek R1 8B (distill) | 8 GB VRAM | 12 GB VRAM |
Arvio: parametrit × tavua-per-kvantti plus ajo- ja kontekstikustannus, pyöristettynä lähimpään todelliseen GPU-kokoon.
Peli-VRAM tarkkuuksittain
Mukavat VRAM-rajat moderneille peleille korkealla — likimääräisiä, ei per-peli viritettyjä.
1080p
8 GB VRAM
1080p high settings — 8GB is the comfortable floor for modern titles.
1440p
12 GB VRAM
1440p high settings — 12GB avoids texture-streaming hitches.
4k
16 GB VRAM
4K high settings — 16GB for texture headroom.