WisePC
Menu
Guide de dimensionnement GPU

Quel GPU pour les LLM locaux ?

Besoins VRAM par modèle pour l'inférence LLM locale (quantifications Q4 et Q8), plus la VRAM gaming par résolution — depuis le même registre que le planificateur.

VRAM par modèle

La mémoire GPU requise pour servir chaque modèle, à contexte 8k. Les contextes plus grands ajoutent ~0,05 Go par 1k tokens.

ModèleQ4 (4 bits)Q8 (8 bits)
Mistral 7B8 Go de VRAM12 Go de VRAM
Llama 3.1 8B8 Go de VRAM12 Go de VRAM
Qwen 2.5 7B8 Go de VRAM12 Go de VRAM
Phi-4 14B12 Go de VRAM20 Go de VRAM
Qwen 2.5 14B12 Go de VRAM20 Go de VRAM
Codestral 22B20 Go de VRAM32 Go de VRAM
Qwen 2.5 32B24 Go de VRAM40 Go de VRAM
Llama 3.1 70B80 Go de VRAM80 Go de VRAM
Qwen 2.5 72B80 Go de VRAM96 Go de VRAM
DeepSeek R1 8B (distill)8 Go de VRAM12 Go de VRAM

Estimation : paramètres × octets-par-quant plus surcoût runtime et contexte, arrondi à la taille GPU réelle la plus proche.

VRAM gaming par résolution

Planchers VRAM confortables pour les titres modernes en élevé — approximatifs, non réglés par titre.

1080p

8 Go de VRAM

1080p high settings — 8GB is the comfortable floor for modern titles.

1440p

12 Go de VRAM

1440p high settings — 12GB avoids texture-streaming hitches.

4k

16 Go de VRAM

4K high settings — 16GB for texture headroom.

Vérifier mon matérielVoir un build chat 32B