Maskinvarekrav for å kjøre en 70B-modell lokalt

En 70B-modell som skal kjøre lokalt, krever først og fremst nok VRAM. Regn ut minnebehovet før du bestiller maskinvare: vekter pluss kontekst, valgt kvantisering og antall samtidige brukere.
VRAM er flaskehalsen

Modellen må ligge i GPU-minnet for å kjøre raskt. Vektene setter minstekravet. For en 70B-modell er det:
- Rundt 40 GB kvantisert til 4-bit.
- Rundt 140 GB i fp16 (full presisjon).
Kontekstvinduet kommer i tillegg, og behovet øker med kontekstlengden. En modell som så vidt får plass med kort kontekst, får ikke plass når du øker lengden.
Tre måter å få nok minne på
1. Ett proff-kort med mye VRAM
Et kort med 96 GB kjører en 70B-modell med god plass til kontekst. Vektene trenger ikke deles over flere kort, så oppsettet er enklest. Det er også dyrest.
2. Ett consumer-kort
Et consumer-kort på 32 GB har for lite minne til 70B ved fornuftig kvantisering. Det holder til en 32B-modell, eller 70B med hard kvantisering, dårligere kvalitet og kort kontekst. Det duger til testing, ikke til produksjon.
3. To kort med tensor-parallell
To 32 GB-kort gir 64 GB samlet, og med tensor-parallell deles vektene til en 70B-modell over begge. Det koster mindre enn ett proff-kort, men krever mer oppsett og en rask forbindelse mellom kortene.
Flere brukere krever batching

Nok VRAM holder når én person bruker modellen. Skal flere bruke den samtidig, trenger du batching. En server som vLLM slår forespørslene sammen og holder gjennomstrømmingen oppe under last. Uten batching faller ytelsen kraftig når bruker nummer to og tre kobler seg på, uansett hvor mye ledig minne det er.
Grov prissortering
AlternativSamlet VRAM70B?Relativ prisEtt consumer-kort32 GBNei (kun 32B)LavestTo consumer-kort64 GBJa, med parallellMellomEtt proff-kort96 GBJa, enkeltHøyest
Prisene svinger mye og endrer seg fort. Tabellen viser bare rekkefølgen. To kort med tensor-parallell gir mest VRAM per krone til 70B, ett proff-kort gir enklest oppsett, og ett consumer-kort alene har for lite minne.


