Wat is een Context Window en waarom is het belangrijk?
Wanneer je een gesprek voert met een AI of een webapplicatie bouwt, stuurt het systeem niet alleen je laatste vraag naar het model. Om een relevant antwoord te geven, moet het model de context van het gesprek of de documenten 'zien'. De maximale hoeveelheid tekst die het model in één keer kan verwerken, noemen we het context window.
Je kunt het vergelijken met het kortetermijngeheugen van de AI. Zodra de input groter wordt dan dit window, begint het model de oudste of minst prominente informatie te 'vergeten'. Dit wordt gemeten in tokens (delen van woorden).
Praktijkvoorbeelden: Wanneer is het cruciaal?
1. Chatgeschiedenis onthouden
Als je iteratief werkt, wil je dat het model zich instructies uit je eerste bericht blijft herinneren. Een klein context window resulteert in een AI die halverwege de sessie eerdere afspraken over opmaak of variabelen kwijtraakt.
2. Lange documenten analyseren
Met geavanceerde modellen zoals Claude Pro, die een zeer ruim context window bieden, kun je uitgebreide rapporten in één keer invoeren om ze te laten analyseren. Bij modellen met een kleiner window loop je tegen foutmeldingen aan of krijg je onvolledige samenvattingen.
3. RAG (Retrieval-Augmented Generation)
RAG werkt uitstekend om de beperkingen van een context window te omzeilen. In plaats van een gigantische database direct in de prompt te proppen, zoekt het systeem met behulp van vector search lokaal naar de meest relevante alinea's (via bijvoorbeeld OpenClaw). Alleen deze specifieke fractie wordt in het context window van modellen zoals DeepSeek of andere LLM's geplaatst. Dit is sneller, goedkoper en accurater.
De Do's en Don'ts
- Do: Gebruik RAG en vector search om je context window selectief te vullen met uitsluitend de meest relevante brokjes informatie.
- Do: Plaats de belangrijkste systeeminstructies aan het absolute begin én herhaal ze indien nodig aan het einde van een lange prompt.
- Don't: Prop niet onnodig veel context in je prompt "voor de zekerheid". Het introduceert ruis en vertraagt de output.
- Don't: Ga er niet vanuit dat het model elk detail feilloos onthoudt als je het maximale aantal tokens van het window opzoekt.
Veelgestelde Vragen (FAQ)
Als ruwe schatting (let op: dit varieert per tokenizer) komt 1 token overeen met ongeveer 0,75 woord in de Engelse taal. Voor het Nederlands ligt deze verhouding vaak iets lager omdat wij veel lange, samengestelde woorden gebruiken.
Uit diverse benchmarks blijkt dat LLM's de neiging hebben om informatie aan het begin en het einde van een volledig gevuld context window goed op te pikken. Cruciale feiten die ergens in het midden van het document verstopt zitten, worden echter sneller over het hoofd gezien.