Hoeveel RAM heeft je laptop nodig om AI lokaal te draaien?

Een download van 3,4 GB met de naam qwen3.5:4b-q4_K_M (een LLM, of groot taalmodel) kan vanavond al een vraag beantwoorden op een gewone laptop met 16 GB, zonder cloudaccount. Haal het model binnen via Ollama, stel één vraag met een 4K-context, en je draait lokaal een AI-model op hardware die je al hebt. Het leest tekst en afbeeldingen, en het gaat hier om inference, niet om training: niemand leert het model iets nieuws, het geeft alleen antwoord.

Een vaag stickertje met ‘AI PC’ op een laptopdoos is geen specificatie. RAM, het geheugen dat je GPU kan gebruiken, opslag en echte softwareondersteuning zijn dat wel. 16 GB geheugen is een serieuze instap voor kleine AI-modellen: niet zo weinig dat je het meteen kunt afschrijven, maar ook geen belofte dat alles uit het specificatieoverzicht zomaar werkt. Meer geheugen geeft je meer context en meer ruimte om meerdere dingen tegelijk te doen. Met 16 GB kun je dus gewoon beginnen.

Wat er echt RAM gebruikt als je AI op je laptop draait

De downloadgrootte van een model en de hoeveelheid RAM die het tijdens gebruik nodig heeft, zijn twee verschillende dingen. Die door elkaar halen is veruit de meest gemaakte fout bij het kiezen van een laptop voor AI. Die 3,4 GB die je downloadt voor qwen3.5:4b-q4_K_M is alleen het bestand op schijf. Om het te laden heb je echt geheugen nodig. Dat geldt ook voor het contextvenster, het lopende gesprek dat het model tijdens het antwoorden vasthoudt, de zogeheten KV-cache. En ook de engine zelf gebruikt geheugen, net als je besturingssysteem en andere apps die al openstaan.

Ollama laadt standaard een context van 4.096 tokens, en je kunt die verhogen. Draai je meerdere verzoeken tegelijk, dan groeit het benodigde contextgeheugen grofweg mee met het aantal parallelle verzoeken. In de specificaties van een model zie je soms een contextvenster van 128K of 256K tokens. Zie dat als het maximum van het model, niet als een belofte dat je laptop met 16 GB alles daarvan tegelijk aankan.

RAM, VRAM en unified memory zijn geen gedeelde voorraad

Apple Silicon-chips gebruiken unified memory: CPU en GPU putten uit dezelfde pool van 16, 24 of 32 GB, dus er is geen apart grafisch geheugen dat eerst volloopt. Een gewone Windows- of Linux-laptop met een aparte NVIDIA-GPU werkt anders. Systeem-RAM en het eigen VRAM van de GPU zijn twee losse geheugens, en 16 GB systeem-RAM plus een GPU van 8 GB is dus niet één vrije pool van 24 GB waar een model zomaar gebruik van maakt.

Past een model niet volledig op de GPU, dan draait een deel via de CPU. Die gedeeltelijke offload kan ervoor zorgen dat een model technisch wel laadt, maar merkbaar trager reageert. Met zie je precies hoe die CPU/GPU-verdeling eruitziet voor wat er op dat moment geladen is.

Capaciteit is maar de helft van het verhaal. Hoe snel dat geheugen data verplaatst, is minstens zo belangrijk: Apple noemt 153 GB/s geheugenbandbreedte voor de MacBook Air M5, en juist die bandbreedte is een echte reden waarom unified memory vlot aanvoelt in plaats van alleen nét voldoende.

Quantisatie: zo past een AI-model van 9B toch in je RAM

Quantisatie verklaart die download van 3,4 GB: door de gewichten van een model met een lagere numerieke precisie op te slaan, wordt het bestand kleiner. Bij Qwen3.5 zie je dat goed terug in het 9B-model. Datzelfde 9B-model download je als 6,6 GB in Q4_K_M, als 11 GB in Q8_0 en als 19 GB in volledige BF16-precisie. Het gaat steeds om hetzelfde model, met hetzelfde aantal parameters, maar met drie heel verschillende downloadgroottes. En opnieuw: dat is de bestandsgrootte, niet de hoeveelheid RAM die tijdens gebruik nodig is.

Lagere precisie kost meestal wat kwaliteit, maar hoeveel dat uitmaakt hangt af van de taak, niet van een vast percentage. Nog iets goed om te weten voordat je Qwen als eerste model kiest: sommige gebruikers melden dat de ‘thinking’-stap merkbare vertraging toevoegt voordat er een antwoord verschijnt, vergeleken met modellen die directer reageren. Het loont dus om beide stijlen op je eigen taken te proberen, in plaats van ervan uit te gaan dat één variant gewoon beter is.

Heb je al een MacBook met 16 GB? Probeer dit eerst

Heb je al een MacBook met 16 GB, begin dan met een model van 2-4B in Q4-precisie en een 4K-context voordat je iets anders koopt. Een 9B-model in Q4, of iets als Gemma 4 12B QAT, laadt misschien ook. Of dat lukt, hangt af van hoeveel andere apps openstaan, hoeveel context je gebruikt en hoe warm de machine al is. Zie het dus als iets dat het proberen waard is, niet als een garantie.

Wil je hier juist iets nieuws voor kopen? De MacBook Air 13-inch met M5-chip heeft standaard 16 GB unified memory en is te configureren tot 32 GB. En voordat een groter scherm als upgrade verleidelijk wordt: de 15-inch M5 Air begint met precies dezelfde geheugenopties van 16, 24 en 32 GB en dezelfde bandbreedte van 153 GB/s als de 13-inch. Kies je schermformaat dus voor comfort, niet omdat je denkt dat je daarmee meer AI-ruimte krijgt. Dat is niet zo.

MacBook Air 13-inch met M5-chip

Heb je al een Windows- of Linux-laptop met 16 GB? Begin hier

Een Windows- of Linux-laptop met 16 GB zonder aparte GPU kan nog steeds een klein model draaien. Ollama werkt native op Windows, dus haal een 2-4B-model in Q4 binnen en probeer het eerst via de CPU of geïntegreerde graphics voordat je iets uitgeeft. Reken op meer verschil in hoe soepel het loopt dan bij Apple Silicon: er is geen vast aantal tokens per seconde dat voor elke machine geldt, simpelweg omdat niet elke configuratie is gemeten.

De Lenovo ThinkPad T14 G2 en de HP EliteBook x360 1040 G7 hebben allebei 16 GB RAM met geïntegreerde graphics, precies deze klasse dus. Eén ding dat je eerst even moet controleren, zeker bij een oudere refurbished machine zoals deze twee: LM Studio vereist AVX2-ondersteuning op Windows x64, en niet elke oudere processor heeft die instructieset. Controleer daarom of jouw specifieke processor die ondersteunt voordat je ervan uitgaat dat elke laptop in deze prijsklasse het gekozen programma ook daadwerkelijk draait.

Lenovo ThinkPad T14 G2-laptop

De valkuil van laptop-GPU-namen: waarom ‘RTX 5070 Ti’ niet genoeg zegt

Laptop-GPU’s van NVIDIA delen hun naam met desktopkaarten, maar die naam zegt minder dan je denkt. De RTX 5060 Laptop GPU heeft 8 GB GDDR7-geheugen en een opgegeven vermogensbereik van 45 tot 100 watt. De RTX 5070 Ti Laptop GPU heeft 12 GB GDDR7 en 60 tot 115 watt. Een online resultaat voor een desktop-RTX 5070 Ti zegt dus niets betrouwbaars over een laptop met RTX 5070 Ti, hoe sterk die namen ook op elkaar lijken.

Er zit nog een tweede valkuil in diezelfde naam. Twee laptops kunnen allebei een ‘RTX 5070 Ti Laptop GPU’ hebben en onder langdurige belasting toch verschillend presteren: een dunne, lichte behuizing en een dikkere, zwaardere laptop voeren warmte anders af, en dezelfde GPU-naam garandeert dus niet dezelfde snelheid in de praktijk zodra de ventilatoren al een tijdje draaien. Controleer altijd de exacte hoeveelheid VRAM en de stroomconfiguratie van de laptop zelf, niet alleen de naam van de GPU-familie.

Nieuw kopen op Mac? Dit is de comfortabele klasse voor unified memory

Koop je specifiek een Mac om regelmatig lokale AI te draaien, dan is 24 tot 32 GB unified memory de comfortabelere keuze van Apple: je houdt dan ruimte over voor een groter model, een langere context of simpelweg andere open apps terwijl je werkt. Kies voor 32 GB als je dit vaak wilt doen en je budget het toelaat.

De MacBook Pro 13-inch met M2-chip is een concreet refurbished voorbeeld dat al boven de instap met 16 GB zit: de 8-core CPU en 10-core GPU gaan samen met maximaal 24 GB unified memory. Het is wel een oudere chipgeneratie dan de M5 Air, dus die bovengrens van 24 GB hoort bij dit model, niet bij de aparte configuratieopties van 24 en 32 GB van de M5 Air.

MacBook Pro 13-inch met M2-chip

Nieuw kopen op Windows of Linux? Zoek een laptop met aparte GPU

Koop je een nieuwe Windows- of Linux-laptop speciaal voor lokale AI, mik dan op 32 GB systeem-RAM in combinatie met een aparte NVIDIA-laptop-GPU met minstens 8 GB eigen VRAM, en liefst 12 GB als een wat zwaardere of duurdere laptop voor jou prima is. 8 GB is een realistisch doel voor 4-7B-modellen in Q4-precisie met een gematigde context, maar ga niet uit van vanzelfsprekende extra ruimte: zelfs de download van 6,6 GB voor een 9B-model in Q4 kan meer vragen dan kale 8 GB om prettig te draaien, en met 12 GB kun je op dat niveau simpelweg makkelijker testen.

De Dell Precision 7730 is een concreet refurbished voorbeeld van het onderliggende idee, ook al gaat het niet om exact dezelfde nieuwe chips als hierboven: 32 GB systeemgeheugen staat hier naast een aparte NVIDIA Quadro P3200 met 6 GB eigen VRAM. Dat is een andere GPU-generatie en -klasse dan NVIDIA’s huidige RTX 5060- en 5070 Ti Laptop GPU’s, maar het principe van gescheiden geheugens blijft hetzelfde.

Dell Precision 7730 mobiele workstation

Een verantwoord alternatief: AMD-laptopchips met veel geheugen

De Ryzen AI Max+ 395 van AMD ondersteunt tot 128 GB LPDDR5x-systeemgeheugen, afhankelijk van hoe de uiteindelijke laptop is geconfigureerd. Dat is een andere geheugenarchitectuur die interessant genoeg is om mee te nemen, maar er zit een duidelijke kanttekening aan: in de Linux-ROCm-ondersteuningslijst van Ollama staat deze chip wel, in de huidige Windows-ROCm-lijst niet.

Dat is geen reden om de chip meteen af te schrijven, maar wel om bij een specifieke laptop eerst het exact geïnstalleerde geheugen, het besturingssysteem, de GPU-back-end, de driver en het gedrag van Ollama te controleren voordat je hem aanbeveelt. Zie een AMD-laptop met veel geheugen daarom als een interessant alternatief dat zorgvuldig onderzoek vraagt, niet als de automatische eerste keuze voor iemand die net begint met AI lokaal draaien.

De softwarelaag: Ollama en LM Studio in gewone taal

Ollama is de eenvoudigste manier om een model op je eigen machine aan de praat te krijgen: haal een model binnen, start het en je hebt een lokale server die verzoeken beantwoordt, zonder cloudaccount voor een gedownload model. Het is de tool achter alle voorbeelden hier.

LM Studio biedt een grafisch alternatief met een eigen modelbrowser en chatvenster. Het noemt ook zijn eigen minimumeisen: minimaal 16 GB RAM op Mac of Windows, AVX2-ondersteuning vereist op Windows x64 en 4 GB aparte VRAM aanbevolen op Windows. Beide tools goed instellen is weer een onderwerp op zich.

Nog één kanttekening voordat je één snelheidsgetal op internet vertrouwt: de officiële tool llama-bench maakt onderscheid tussen de snelheid van promptverwerking en de snelheid van generatie, en laat ook zien hoeveel variatie er is tussen herhaalde tests in plaats van maar één getal te geven. Een forumbericht met één waarde voor tokens per seconde vertelt zelden welke van die twee is gemeten, of hoe vaak de test is herhaald.

Checklist als je een AI-klare laptop wilt kopen of upgraden

Koop of upgrade je specifiek voor lokale AI, kijk dan naar de details in plaats van naar de marketing.

Exact GPU-model en hoeveelheid VRAM. Niet alleen de naam van de GPU-familie, maar de precieze laptopvariant en de eigen geheugencapaciteit, want achter dezelfde naam kan verschillende VRAM schuilgaan.

Vastgesoldeerd of uitbreidbaar RAM. Bij sommige laptops kun je later geheugen toevoegen, bij veel moderne dunne en lichte modellen niet. Weet dus wat je koopt.

Vrije SSD-opslag. Modeldownloads lopen van minder dan 1 GB tot ruim boven de 10 GB, en een groeiende verzameling tikt snel aan naast je andere bestanden.

Thermisch gedrag bij langdurige belasting. Een model dat één vraag beantwoordt en een laptop die meerdere verzoeken achter elkaar verwerkt, zijn twee verschillende tests. Ventilatorgeluid en throttling na herhaalde prompts zeggen meer dan een korte demo.

Ondersteuning van OS en drivers. Controleer of jouw exacte combinatie van GPU-back-end en besturingssysteem door Ollama of LM Studio wordt ondersteund voordat je ervan uitgaat dat het werkt.

Het TOPS-getal van de NPU op de doos is geen garantie voor doorvoersnelheid. Het is een marketingcijfer, geen getest resultaat van de engine die jij gaat gebruiken. Een vaag label als ‘AI PC’ vervangt geen enkele controle hierboven.

Veelgestelde vragen over AI draaien op een laptop

Heb ik een aparte GPU nodig om AI lokaal te draaien?

Nee. Een klein model draait op veel laptops met 16 GB via de CPU of geïntegreerde graphics, alleen met meer verschil in snelheid dan op een laptop met een aparte GPU. Begin met een model van 2-4B voordat je ervan uitgaat dat je aparte graphics nodig hebt.

Werkt 8 GB RAM ook?

Niet comfortabel voor de modellen die hier aan bod komen. 16 GB is het realistische startpunt zodra je rekening houdt met het model, het contextvenster, de engine en je besturingssysteem, die allemaal hetzelfde geheugen delen.

Is een model lokaal draaien hetzelfde als het trainen?

Nee. Alles hierboven gaat over inference: vragen stellen aan een model dat al getraind is. Training bouwt een model vanaf nul op en vraagt veel meer hardware dan welke laptop hier ook biedt.

Geeft meer RAM gegarandeerd snellere antwoorden?

Nee. Meer geheugen geeft speelruimte voor grotere modellen, langere context en meer open apps, maar de echte snelheid hangt af van geheugenbandbreedte, de GPU-back-end en het specifieke model, niet alleen van de hoeveelheid geheugen.

Blijven mijn gegevens privé als een model lokaal draait?

Ja, in die zin dat je prompts op je eigen machine blijven in plaats van naar een cloudprovider te gaan. Ollama luistert standaard alleen op je eigen laptop en verstuurt nergens anders verzoeken naartoe, tenzij je zelf bewust cloudtoegang instelt.

Probeer het vanavond al, shop daarna met vertrouwen

Heb je al een laptop met 16 GB? Installeer vanavond nog Ollama en draai eerst één klein model voordat je ook maar iets uitgeeft aan iets nieuws. Koop je hier juist specifiek voor? Gebruik dan de checklist hierboven en de vijf refurbished laptops die we net hebben besproken als eerste vergelijking, niet een marketingblad vol specificaties.

Elke laptop op refurbed wordt getest en beoordeeld voordat hij online komt. De RAM en configuratie die je koopt, zijn dus ook de RAM en configuratie die je krijgt. De volgende gids in deze serie laat zien hoe je je eerste app koppelt aan het model dat je net hebt geprobeerd.

Opengeklapte MacBook Air op een bureau, klaar om een lokaal AI-model te draaien

Meld je aan voor onze nieuwsbrief en ontvang €15 korting!

Mis nooit meer een aanbieding.

Informatie over het gebruik van persoonsgegevens vind je in ons privacybeleid.