Local AI inference: ghid de cerințe hardware
Rulezi LLM-uri sau alte modele local (Ollama, vLLM, llama.cpp).
Cerințe hardware pe niveluri
Trei niveluri pentru fiecare workload: minimul care funcționează, nivelul recomandat și nivelul confortabil. Acestea sunt aceleași niveluri pe care motorul de decizie WisePC le folosește când planifică un build în jurul obiectivului tău.
| Nivel | Nuclee CPU | RAM | Stocare | GPU | VRAM | Rețea |
|---|---|---|---|---|---|---|
| Minimum | 8 cores | 16 GB | 1 TB (ssd) | ai | 12 GB VRAM | 1 GbE |
| Recomandat | 12 cores | 32 GB | 1 TB (ssd) | ai | 16 GB VRAM | 2.5 GbE |
| Confortabil | 16 cores | 64 GB | 2 TB (ssd) | ai | 24 GB VRAM | 10 GbE |
| Excesiv | 26 cores | 103 GB | 4 TB (ssd) | ai | 24 GB VRAM | 10 GbE |
Dincolo de Confortabil — 26 nuclee, 103 GB RAM, 4 TB (SSD): headroom pe care nu-l vei folosi niciodată doar pentru acest workload. Pune diferența în stocare, backup sau liniște.
Forma recomandată a sistemului
Derivată de motorul de decizie din nivelul recomandat — aceeași logică ce planifică build-urile complete.
- Factor de formă
- tower
- Stil de construcție
- diy
- Plan de unități
- 2× 2TB NVMe
Requirements (12 threads, 32GB RAM, 4TB storage, dedicated GPU) need a custom tower build.
Un singur sistem sau unul separat?
Dacă acest workload merită propriul sistem sau ar trebui să stea pe serverul principal.
Rămâne pe serverul principal
GPU-bound compute is expensive to duplicate — a second GPU box roughly doubles cost for little resilience gain. Keep it on the main machine.
Matrice de stocare, cu prețuri
Cinci strategii fizice pentru capacitatea recomandată — același planner, același model de unități și prețuri de referință ca tool-ul de stocare.
| Strategie | Unități | Util | Cost | Idle |
|---|---|---|---|---|
| Cheapest | 1× 4TB hdd | 4 TB · none | ≈ €100 | 5 W |
| Balanced | 1× 16TB hdd | 16 TB · none | ≈ €240 | 6 W |
| Redundant | 3× 8TB hdd | 8 TB · parity2 | ≈ €450 | 15 W |
| Expansion-friendly | 1× 20TB hdd | 20 TB · none | ≈ €300 | 7 W |
| PerformanceRecomandat | 2× 4TB nvme | 4 TB · parity1 | ≈ €480 | 2 W |
For a fast working tier, go all-flash — the performance strategy protects speed without the HDD rebuild pain.
Backup-ul nu e stocare
Copia extra care supraviețuiește defectării discurilor, ștergerilor și ransomware-ului — același motor ca planner-ul de backup.
Protect 1TB with at least two copies on separate hardware, ideally one offsite. The recommended start is a dedicated NAS.
Recomandat: Separate NAS — A dedicated box that only stores backups · ≈ €278
- No offsite copy (high): Add a second copy outside the building — cloud or a drive at a friend's house.
- No versioning (medium): Use a versioning-aware tool (restic, borg, Backblaze) that keeps history.
- Unscheduled backups (medium): Schedule backups automatically and monitor them.
- Backup on the same machine (medium): Keep the backup on separate hardware or offsite.
Cât va costa?
Benzi neutre de piață în EUR din modelul de referință (≈ = preț stradal estimat). Prețurile live ale componentelor se rezolvă pe pagina de build pentru regiunea ta.
- Matrice de stocare
- ≈ €100 – €480
- Energie matrice / an
- ≈ €81/yr (∼37 W idle)
Calculul (CPU, placă, RAM, GPU) nu e inclus — vezi build-ul recomandat pentru prețuri live.
Perspectiva de creștere
Ce se întâmplă când datele cresc în continuare — același motor ca simulatorul de creștere.
This architecture becomes inadequate in year 2 — 2 bays needed. Plan the next step (bigger array, NAS or DAS, or a stronger platform) before then.
Exceeds max 2TB by 1TB — need larger array/DAS/NAS. Fresh Performance array for 3TB: 2 bays, ~480€.
Acoperit tot în acest ghid
Asistent de cod (LLM local)
Completare de cod locală și modele de chat (Ollama, Continue).
Ce nivel ai nevoie?
- Alege Minimum (8 nuclee, 16 GB RAM) doar pentru o mașină cu un singur scop și buget strâns — așteaptă-te la headroom mic.
- Recomandat (12 nuclee, 32 GB RAM) e punctul optim: suficient pentru workload plus serviciile secundare obișnuite, fără să plătești în plus.
- Alege Confortabil (16 nuclee, 64 GB RAM) când workload-ul împarte mașina cu altele sau va crește — plătești pentru headroom, nu pentru stres.
- Regula de GPU pentru acest workload: ai.Regula de GPU pentru acest workload: ai (16 GB VRAM).
Întrebări frecvente
Cât RAM are nevoie local ai inference?
16 GB este minimul rațional, 32 GB acoperă majoritatea configurărilor reale, iar 64 GB oferă headroom confortabil pentru creștere și servicii extra.
Câte nuclee de CPU are nevoie local ai inference?
Un CPU cu 8 nuclee este minimul, 12 nuclee este punctul optim recomandat, iar 16 nuclee este confortabil când împarte mașina cu alte workload-uri.
Are nevoie local ai inference de un GPU dedicat?
Un GPU dedicat este puternic recomandat — acest workload face calcul AI. Necesită 12–24 GB VRAM (12 minim, 16 recomandat, 24 confortabil).
Ce stocare și rețea așteaptă local ai inference?
Stocare: 1 TB de SSD este nivelul recomandat (1 TB minim, 2 TB confortabil). Rețea: 2.5 GbE este nivelul recomandat.
Ce merge bine alături de local ai inference?
Se potrivește natural cu: Generare de imagini, Experimentare AI, Baze de date.
Câtă energie consumă local ai inference?
Matricea de stocare stă în idle la ~37 W (≈ 81 €/an la 0,25 €/kWh). Sistemul complet adaugă CPU, placă și ventilatoare — vezi secțiunea de cost pentru benzi oneste.