WisePC
Menu
Guida al dimensionamento GPU

Quale GPU per gli LLM locali?

Fabbisogno VRAM per modello per l'inferenza LLM locale (quantizzazione Q4 e Q8), più VRAM gaming per risoluzione — dallo stesso registro del planner.

VRAM per modello

Quanta memoria GPU serve a ciascun modello, con contesto 8k. Contesti maggiori aggiungono ~0,05 GB ogni 1k token.

ModelloQ4 (4-bit)Q8 (8-bit)
Mistral 7B8 GB di VRAM12 GB di VRAM
Llama 3.1 8B8 GB di VRAM12 GB di VRAM
Qwen 2.5 7B8 GB di VRAM12 GB di VRAM
Phi-4 14B12 GB di VRAM20 GB di VRAM
Qwen 2.5 14B12 GB di VRAM20 GB di VRAM
Codestral 22B20 GB di VRAM32 GB di VRAM
Qwen 2.5 32B24 GB di VRAM40 GB di VRAM
Llama 3.1 70B80 GB di VRAM80 GB di VRAM
Qwen 2.5 72B80 GB di VRAM96 GB di VRAM
DeepSeek R1 8B (distill)8 GB di VRAM12 GB di VRAM

Stima: parametri × byte-per-quant più overhead di runtime e contesto, arrotondato alla taglia GPU reale più vicina.

VRAM gaming per risoluzione

Soglie VRAM confortevoli per titoli moderni su alto — approssimative, non tarate per titolo.

1080p

8 GB di VRAM

1080p high settings — 8GB is the comfortable floor for modern titles.

1440p

12 GB di VRAM

1440p high settings — 12GB avoids texture-streaming hitches.

4k

16 GB di VRAM

4K high settings — 16GB for texture headroom.

Verifica il mio hardwareVedi una build chat 32B