
Onsite offline LLM med RAG: tilgangskontroll per chunk og vLLM
Et lokalt RAG-system som svarer ansatte ut fra firmaets egne kilder, med tilgangskontroll per chunk og vLLM for gjennomstrømming.

Et lokalt RAG-system som svarer ansatte ut fra firmaets egne kilder, med tilgangskontroll per chunk og vLLM for gjennomstrømming.

En 70B-modell trenger rundt 40 GB VRAM på 4-bit og 140 GB i fp16, og valget står mellom ett proff-kort, ett consumer-kort eller to kort med tensor-parallell.

Engelske embedding-modeller presterer dårlig på norsk tekst, og da hjelper det ikke hvor god språkmodellen bakerst er.