Quel GPU pour les LLM locaux ?
Besoins VRAM par modèle pour l'inférence LLM locale (quantifications Q4 et Q8), plus la VRAM gaming par résolution — depuis le même registre que le planificateur.
VRAM par modèle
La mémoire GPU requise pour servir chaque modèle, à contexte 8k. Les contextes plus grands ajoutent ~0,05 Go par 1k tokens.
| Modèle | Q4 (4 bits) | Q8 (8 bits) |
|---|---|---|
| Mistral 7B | 8 Go de VRAM | 12 Go de VRAM |
| Llama 3.1 8B | 8 Go de VRAM | 12 Go de VRAM |
| Qwen 2.5 7B | 8 Go de VRAM | 12 Go de VRAM |
| Phi-4 14B | 12 Go de VRAM | 20 Go de VRAM |
| Qwen 2.5 14B | 12 Go de VRAM | 20 Go de VRAM |
| Codestral 22B | 20 Go de VRAM | 32 Go de VRAM |
| Qwen 2.5 32B | 24 Go de VRAM | 40 Go de VRAM |
| Llama 3.1 70B | 80 Go de VRAM | 80 Go de VRAM |
| Qwen 2.5 72B | 80 Go de VRAM | 96 Go de VRAM |
| DeepSeek R1 8B (distill) | 8 Go de VRAM | 12 Go de VRAM |
Estimation : paramètres × octets-par-quant plus surcoût runtime et contexte, arrondi à la taille GPU réelle la plus proche.
VRAM gaming par résolution
Planchers VRAM confortables pour les titres modernes en élevé — approximatifs, non réglés par titre.
1080p
8 Go de VRAM
1080p high settings — 8GB is the comfortable floor for modern titles.
1440p
12 Go de VRAM
1440p high settings — 12GB avoids texture-streaming hitches.
4k
16 Go de VRAM
4K high settings — 16GB for texture headroom.