Je laptop beantwoordt een vraag, helemaal offline. Zonder iets aan te passen krijgt daarna ook een tweede app op diezelfde laptop antwoord op precies dezelfde vraag. Zo maak je van de laptop die je al gebruikt je eigen kleine AI-dienst die andere apps en scripts kunnen aanroepen.
Je draait hier een gedownload model, maar traint het niet. Heb je nog niet gecontroleerd of je laptop genoeg RAM of VRAM heeft? Lees dan eerst hoeveel RAM je laptop nodig heeft voor lokale AI. Weet je al dat je laptop geschikt is? Dan kun je verder.
Elke lokale AI-opstelling heeft vier lagen. Als je weet welke laag wat doet, kun je de stappen hieronder makkelijker volgen.
Modelgewichten zitten in het bestand dat je downloadt. Een gekwantiseerde versie van een klein model is bijvoorbeeld 3,4 GB groot. Dat is de downloadgrootte op schijf, niet de hoeveelheid RAM die het model nodig heeft zodra het draait.
De inferentiesoftware laadt die gewichten en beantwoordt verzoeken. In deze gids gebruiken we Ollama, dat een eigen lokale HTTP-API heeft. Dankzij die software kunnen ook andere apps je laptop als AI-dienst gebruiken.
De front-end verstuurt het verzoek. Je kunt daarvoor de ingebouwde chat van Ollama gebruiken, een kort script of een aparte app. Die keuze bepaalt of je prompt op je laptop blijft of ergens anders naartoe wordt gestuurd.
Een optionele documentindex laat een chatmodel je eigen bestanden doorzoeken. Daarvoor heb je een apart embeddingmodel en opslag voor de index nodig. Zo’n index wordt niet automatisch aangemaakt en valt buiten deze gids.
Kortom: een app of script stuurt een verzoek naar 127.0.0.1:11434. Dat is het adres van Ollama, dat het gedownloade model laadt. Verwijder je een gedownload model, dan wis je daarmee niet de chatgeschiedenis die een front-end heeft opgeslagen. Die staat op een andere plek.
Neem voordat je iets installeert twee minuten de tijd om de specificaties van je laptop te noteren: hoeveel RAM je hebt, welk besturingssysteem en welke processor je gebruikt, hoeveel apart videogeheugen (VRAM) er eventueel is en hoeveel ruimte er vrij is op je SSD. Waarom RAM en VRAM ertoe doen, lees je in hoeveel RAM je laptop nodig heeft voor lokale AI.
De twee laptops hieronder staan momenteel op refurbed. Ze zijn allebei refurbished: professioneel getest, schoongemaakt en opgeknapt, met 12 maanden garantie. De ene is een instapmodel van Apple met Apple Silicon; de andere een Windows-laptop met apart videogeheugen. Met beide kun je alle stappen hieronder doorlopen.
Installeer op macOS of Windows de officiële Ollama-app. Gebruik je Linux, volg dan de installatie-instructies van Ollama. Open Ollama na de installatie. Voer op Linux ollama serve uit als er nog geen server luistert.
Je kunt in de huidige app kiezen voor lokaal draaien of voor een van de cloudopties. Kies de tag van een gedownload, lokaal model. Voor lokale inferentie hoef je niet in te loggen.
Download voor deze gids precies dit model: qwen3.5:4b-q4_K_M (3,4 GB). Gebruik de volledige tag: het algemene label “latest” kan ongemerkt naar een veel groter model verwijzen dan het model dat je hebt getest. Die 3,4 GB is de grootte op schijf, niet het benodigde RAM. Hoeveel geheugen het model nodig heeft om verzoeken te beantwoorden, kun je daar dus niet uit afleiden.
Je hebt twee opdrachten nodig om voor het eerst met een model te chatten:
ollama pull qwen3.5:4b-q4_K_M
ollama run qwen3.5:4b-q4_K_M
Met de eerste download je het model, met de tweede start je een interactieve chat. Geef het model liever één kleine, concrete opdracht dan een standaardbegroeting, bijvoorbeeld: “Maak van deze drie vergadernotities een actielijst. Verzin geen datums.”
Typ na afloop /bye om de chat te verlaten.
Chat je in de terminal, dan stuurt de front-end je verzoeken naar Ollama. Nu benader je die software rechtstreeks, zoals een andere app dat zou doen.
Op macOS of Linux:
curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Definieer lokale inferentie in één zin."}],"stream":false,"options":{"num_ctx":4096}}'
In PowerShell op Windows:
Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Definieer lokale inferentie in één zin."}],"stream":false,"options":{"num_ctx":4096}}'
Zoek in het antwoord naar message.content. Met stream op false vraag je om één compleet antwoord, niet om losse stukjes. Met num_ctx: 4096 kies je voor deze eerste test een bescheiden contextlengte, ruim onder het opgegeven maximum van het model.
Ollama geeft meer terug dan alleen het antwoord. Let naast message.content ook op deze velden voor tijdsduur en aantallen: load_duration, prompt_eval_count, prompt_eval_duration, eval_count en eval_duration.
Aan die velden zie je afzonderlijk hoeveel tijd het kost om het model in het geheugen te laden en hoeveel tijd nodig is om je antwoord te genereren. Eén getal voor “tokens per seconde” laat dat verschil niet zien. Het eerste verzoek na het starten van Ollama duurt meestal het langst, omdat het model dan nog geladen moet worden. Bij het volgende verzoek hoeft dat niet opnieuw.
De precieze cijfers hangen volledig af van je eigen laptop. Daarom noemen we hier geen doorsneecijfers. Vergelijk liever de waarden uit deze velden voor twee verzoeken op dezelfde laptop dan af te gaan op één losse snelheidsclaim.
Voor de basis heb je genoeg aan drie opdrachten.
ollama ps laat zien welke modellen nu geladen zijn. In de processorkolom staat 100% GPU, 100% CPU of een verdeling over beide.
ollama ls toont alle modellen die je hebt gedownload.
Met ollama rm qwen3.5:4b-q4_K_M verwijder je het gedownloade model als je het niet meer nodig hebt.
Ollama haalt een model standaard na vijf minuten zonder activiteit uit het geheugen. Toont ollama ps geen geladen modellen? Stuur dan eerst nog een verzoek voordat je ervan uitgaat dat er iets mis is.
In deze stap maak je van je laptop ook een AI-dienst voor een tweede app. Die app verbind je met je laptop, niet met een clouddienst.
Bij de meeste apps waarin je zelf een OpenAI-compatibel API-adres kunt instellen, vul je drie gegevens in: een basis-URL, een modelnaam en een API-sleutel. Vul als basis-URL http://localhost:11434/v1/ in en als modelnaam qwen3.5:4b-q4_K_M.
De API-sleutel kan voor verwarring zorgen. Sommige apps accepteren geen leeg veld. Daarom gebruikt Ollama in zijn documentatie api_key='ollama' als invulwaarde. Volgens Ollama vereist de lokale server een niet-leeg veld, maar negeert hij de ingevulde waarde. Die tekenreeks is geen wachtwoord en bewijst niet wie je bent; hij dient alleen om het veld te vullen.
Bovendien zijn de API's maar deels compatibel. Wil je bijvoorbeeld afbeeldingen invoeren of tools aanroepen? Test die functie dan met de app die je gebruikt, in plaats van ervan uit te gaan dat alles werkt.
Tot nu toe kon de software in theorie ongemerkt verbinding maken met internet. Zo sluit je dat uit.
Zodra het model helemaal is gedownload, zet je de wifi van je laptop uit of trek je de netwerkkabel eruit. Herhaal je eerdere verzoek in de chat of via de API. Krijg je zonder enige verbinding een inhoudelijk antwoord, dan heb je aangetoond dat het model lokaal draait.
Dit telt niet als bewijs: een antwoord dat je alleen online krijgt, een reactie van https://ollama.com in plaats van localhost, of een tag van een cloudmodel in plaats van die van een gedownload model. Volgens Ollama blijft een lokaal verzoek op je eigen laptop; verzoeken aan de afzonderlijke cloudmodellen lopen via externe servers.
Lokaal draaien maakt deze opstelling niet vanzelf privé. Het is dus goed te weten welke bescherming je hebt en waar die ophoudt.
Ollama luistert standaard alleen op 127.0.0.1:11434. Het accepteert dan alleen verzoeken vanaf je eigen laptop, niet vanaf andere apparaten. Laat dat zo. Stel OLLAMA_HOST=0.0.0.0 niet in en maak poort 11434 niet via portforwarding bereikbaar vanaf het openbare internet. De API-sleutel uit het vorige onderdeel is alleen een invulwaarde. Daarmee beveilig je een open poort niet.
Wil je de cloudfuncties van Ollama helemaal uitschakelen? Dat hoeft niet: met de tag van een gedownload lokaal model kies je al voor lokaal draaien. Wil je ze toch uitzetten, voeg dan {"disable_ollama_cloud": true} toe aan ~/.ollama/server.json of stel OLLAMA_NO_CLOUD=1 in. Start Ollama daarna opnieuw om de wijziging actief te maken.
Ollama vanaf een ander apparaat of vanuit een andere kamer bereiken vraagt om een aparte, geavanceerdere aanpak: een privénetwerk en een proxy met authenticatie. Dat behandelen we hier niet. De poort rechtstreeks openzetten is geen oplossing.
Loop je tegen een van deze veelvoorkomende problemen aan? Dit kun je als eerste controleren.
Verbinding geweigerd. Controleer of de Ollama-app of ollama serve draait en probeer het opnieuw.
Het eerste antwoord duurt lang, de volgende komen sneller. Dat komt doordat het model nog moet worden geladen, niet doordat het antwoord langzaam wordt gegenereerd. In de eerder genoemde antwoordvelden zie je het verschil.
Alles voelt veel trager aan dan verwacht. Voer ollama ps uit om te zien of het model alleen op de CPU draait of de belasting over CPU en GPU is verdeeld. Controleer of je besturingssysteem je GPU en de bijbehorende stuurprogramma’s ondersteunt.
Geheugenproblemen of crashes. Gebruik een tag van een kleiner model, verlaag num_ctx en sluit andere apps die veel geheugen gebruiken voordat je het opnieuw probeert.
De schijf loopt vol. Bekijk met ollama ls welke modellen je hebt gedownload. Verwijder de modellen die je niet gebruikt met ollama rm.
Past deze aanpak niet bij je, bijvoorbeeld omdat je modellen liever via een grafische interface bekijkt of meer controle wilt over CPU en GPU? Dan zijn LM Studio en llama.cpp het bekijken waard als alternatief voor Ollama, niet als extra opstelling ernaast.
Heb ik na het instellen nog internet nodig? Nee. Als het model eenmaal is gedownload, kun je er helemaal offline mee chatten en de API aanroepen.
Beveiligt de ingevulde API-sleutel mijn lokale API? Nee. De lokale server van Ollama accepteert elke niet-lege waarde zonder die te controleren. De sleutel waar sommige apps om vragen, biedt dus geen beveiliging.
Blijft mijn prompt op mijn laptop? Ja, als je de tag van een gedownload lokaal model gebruikt. Ollama heeft ook aparte cloudmodellen die via externe servers werken. Het verschil zit in de gekozen tag, niet in een verborgen standaardinstelling.
Heb ik een aparte videokaart nodig? Nee. Een laptop die alleen de CPU gebruikt, kan een klein model draaien, al gaat dat doorgaans langzamer. Met ollama ps zie je precies hoe een bepaald verzoek is verwerkt.
Wat als ik een groter of ander model wil? Controleer eerst hoeveel RAM en VRAM je laptop heeft. Vervang daarna de tag in ollama pull en ollama run. In hoeveel RAM je laptop nodig heeft voor lokale AI lees je waarom.
Onthoudt het chatmodel mijn documenten voortaan? Nee. Een chatmodel onthoudt niet vanzelf blijvend wat er in een map staat. Wil je eigen bestanden doorzoeken, dan heb je een aparte documentindex nodig. Die optionele opstelling behandelen we hier niet.
Kies één concrete taak en voer die twee keer uit: in de ingebouwde chat en in de tweede app die je net hebt gekoppeld. Laat bijvoorbeeld een persoonlijke notitie samenvatten, een reeks bestanden in gelabelde groepen indelen of een kort stukje code in gewone taal uitleggen.
Noteer de taak die je kiest, de exacte modeltag, de versie van de inferentiesoftware, de contextinstelling en de URL. Zo kun je het resultaat later reproduceren, en anderen die hetzelfde willen proberen ook.
Blijkt je laptop hiervoor te weinig RAM of VRAM te hebben, dan is overstappen op een laptop met meer geheugen het overwegen waard. In het volgende artikel in deze reeks lees je hoe je een kleine set modellen samenstelt: één voor chat, één voor code en één voor zoekopdrachten.
Meld je aan voor onze nieuwsbrief en ontvang €15 korting!
Mis nooit meer een aanbieding.
Informatie over het gebruik van persoonsgegevens vind je in ons privacybeleid.
Bevestig aanmelding
Klik op de link in onze bevestigingsmail om je voucher te ontvangen. Deze is geldig bij aankopen vanaf € 200.