Kjøre språkmodeller lokalt med Ollama eller LM Studio: verktøy og maskinvarekrav

Store språkmodeller (LLM) kan kjøres lokalt på egen maskin. Da blir dataene på eget nettverk og sendes ikke til ChatGPT eller andre skytjenester. Personvern er det spørsmålet jeg oftest får fra bedrifter som vurderer AI.
Hva en lokal LLM er
En lokal LLM kjører på egen maskinvare: en arbeidsstasjon, en server i serverrommet eller en egen GPU-maskin. ChatGPT og Claude behandler alt i skyen. En lokal modell holder dataene på ditt eget utstyr. Det er relevant for bedrifter som håndterer kundeopplysninger, kontrakter, helsejournaler eller finansielle data.
Ollama og LM Studio
Ollama er et kommandolinjeverktøy som laster ned og kjører åpne språkmodeller. ollama run llama3 gir en lokal modell i gang i løpet av minutter. Ollama støtter blant annet Llama 3, Mistral, Phi-3 og CodeLlama (for kode), og har et API som andre verktøy og applikasjoner kan kalle.
LM Studio gjør det samme med et grafisk grensesnitt. Du blar gjennom modeller, laster dem ned med ett klikk og chatter med dem i programmet. Det passer for den som vil prøve flere modeller uten å bruke terminalen.
Maskinvarekrav
Lokal AI krever mer maskinvare enn vanlige kontoroppgaver.
Små modeller (7B parametre) trenger minst 16 GB RAM og en nyere prosessor (Intel i7/AMD Ryzen 7 eller bedre). De gir gode resultater på oppsummering, enkel tekstbehandling og kodehjelp. Et eget grafikkort er ikke nødvendig, for mange modeller kjører greit på CPU, bare tregere.
Større modeller (13B–70B parametre) trenger et eget grafikkort med mye VRAM. Et NVIDIA RTX 4090 med 24 GB VRAM kjører de fleste 13B-modeller godt. 70B-modeller krever profesjonelle kort eller flere GPU-er, og da koster grafikkortene alene 30 000–100 000 kroner.
Kvantisering komprimerer modellene, for eksempel fra 16-bit til 4-bit. Da kan langt større modeller kjøres på mindre maskinvare, med litt lavere kvalitet. En 4-bit kvantisert 13B-modell kjører greit på 16 GB VRAM.
Når lokal AI lønner seg
Skytjenester som GPT-4 og Claude gir fortsatt bedre svar på de fleste komplekse oppgaver. Lokal AI er et bedre valg i disse tilfellene:
- Sensitive data underlagt GDPR eller andre reguleringer. Ingen data forlater nettverket.
- Høyt volum, for eksempel automatisk kategorisering av e-post eller støttehenvendelser. Sky-API-er tar betalt per forespørsel, så lokal kjøring kan bli billigere over tid.
- Bruk uten internettforbindelse.
- Testing og tilpasning av modeller uten API-kostnader.
Slik kommer du i gang
Start med Ollama. Installer det på en maskin med minst 16 GB RAM, kjør ollama run llama3 og test det på oppgaver fra din egen hverdag. Vurder deretter om svarene holder, eller om du også trenger skytjenester. De fleste ender med begge deler: lokal AI for sensitive oppgaver og sky-API-er for de mest krevende.


