WisePC
Menü
GPU-Dimensionierung

Welche GPU für lokale LLMs?

VRAM-Bedarf pro Modell für lokale LLM-Inferenz (Q4- und Q8-Quantisierung) plus Gaming-VRAM nach Auflösung — aus demselben Register wie der Planner.

VRAM pro Modell

So viel GPU-Speicher braucht jedes Modell zum Servieren, bei 8k Kontext. Größere Kontexte addieren ca. 0,05 GB pro 1k Token.

ModellQ4 (4-Bit)Q8 (8-Bit)
Mistral 7B8 GB VRAM12 GB VRAM
Llama 3.1 8B8 GB VRAM12 GB VRAM
Qwen 2.5 7B8 GB VRAM12 GB VRAM
Phi-4 14B12 GB VRAM20 GB VRAM
Qwen 2.5 14B12 GB VRAM20 GB VRAM
Codestral 22B20 GB VRAM32 GB VRAM
Qwen 2.5 32B24 GB VRAM40 GB VRAM
Llama 3.1 70B80 GB VRAM80 GB VRAM
Qwen 2.5 72B80 GB VRAM96 GB VRAM
DeepSeek R1 8B (distill)8 GB VRAM12 GB VRAM

Schätzung: Parameter × Byte-pro-Quant plus Runtime- und Kontext-Overhead, aufgerundet auf die nächste reale GPU-Größe.

Gaming-VRAM nach Auflösung

Komfortable VRAM-Untergrenzen für moderne Titel auf Hoch — approximativ, nicht pro Titel getunt.

1080p

8 GB VRAM

1080p high settings — 8GB is the comfortable floor for modern titles.

1440p

12 GB VRAM

1440p high settings — 12GB avoids texture-streaming hitches.

4k

16 GB VRAM

4K high settings — 16GB for texture headroom.

Meine Hardware prüfen32B-Chat-Build ansehen