Home / Inzichten / Hoe genereren LLM's antwoorden? Uitleg in gewone taal
Technisch

Hoe genereren LLM's antwoorden? Uitleg in gewone taal

Vat samen met AI Prompt gekopieerd — plak hem in de chat

Een large language model (LLM) genereert een antwoord door het meest waarschijnlijke volgende stukje tekst te voorspellen — token voor token — op basis van patronen die het heeft geleerd uit een enorme hoeveelheid trainingsdata. Het zoekt geen feiten op in een database en redeneert niet vanuit vaste regels; het berekent een kansverdeling over mogelijke volgende tokens, kiest er één, voegt die toe en herhaalt dit tot het antwoord af is. Kortom: het voorspelt plausibele tekst in plaats van exacte feiten op te halen — daarom is het vloeiend, snel en af en toe met overtuiging fout.

Het korte antwoord

Stel een LLM een vraag en het lijkt alsof het het antwoord weet. Onder de motorkap gebeurt iets eenvoudigers: het model raadt steeds het volgende woord. Een LLM genereert tekst door het volgende token te voorspellen, en dan het volgende, en het volgende — elk op basis van alles wat eraan voorafging.

Dat ene idee — next-token-voorspelling — verklaart vrijwel al het gedrag van deze modellen: waarom ze zo vloeiend zijn, waarom ze soms dingen verzinnen, en waarom de juiste context zo belangrijk is. De rest van deze gids legt het uit, zonder wiskunde.

Wat een LLM eigenlijk is

Een large language model is een zeer groot neuraal netwerk dat is getraind op een enorme hoeveelheid tekst — boeken, artikelen, code, webpagina's. Tijdens de training krijgt het tekstfragmenten te zien waarin het volgende woord verborgen is, en leert het dat ontbrekende woord te voorspellen. Doe dit miljarden keren over biljoenen woorden en het model legt geleidelijk patronen vast: grammatica, feiten, schrijfstijlen en verbanden tussen ideeën.

Die patronen zitten opgeslagen als parameters — numerieke gewichten, vaak honderden miljarden. Het model is geen database met zinnen die het kan opzoeken. Het is een gecomprimeerde, statistische kaart van hoe taal doorgaans in elkaar past. Geeft u een prompt, dan gebruikt het die kaart om uw tekst zo plausibel mogelijk voort te zetten.

Stap 1: Uw woorden worden tokens

Voordat het model uw vraag ziet, wordt de tekst opgeknipt in tokens — kleine stukjes die vaak hele woorden zijn, maar ook delen van woorden of leestekens kunnen zijn.

Elk token verwijst naar een getal, en elk getal naar een lange reeks waarden (een embedding) die de betekenis van het token vastlegt en hoe het zich tot andere verhoudt. Tokens zijn de eenheid waarmee het model werkt — en daarom worden prijzen en limieten in tokens gemeten, niet in woorden.

Stap 2: Het volgende token voorspellen

Dit is de kern. Gegeven de tokens tot nu toe berekent het model een kans voor elk mogelijk volgend token in zijn vocabulaire. Bij "De hoofdstad van Nederland is" krijgt "Amsterdam" een zeer hoge kans en duizenden andere tokens een verwaarloosbare.

Vervolgens kiest het één token uit die verdeling, voegt het toe aan de tekst en draait de hele berekening opnieuw — nu inclusief het zojuist geproduceerde token. Een antwoord genereren is deze lus, token voor token herhaald, tot het model een natuurlijk eindpunt voorspelt. Het model ziet het voltooide antwoord nooit vooraf; het schrijft zich er stap voor stap naartoe.

  • Temperatuur bepaalt hoe gewaagd die keuze is. Een lage temperatuur neemt bijna altijd het meest waarschijnlijke token (consistent, voorspelbaar); een hogere temperatuur laat minder waarschijnlijke tokens toe (gevarieerder en creatiever — maar ook foutgevoeliger).
  • Dit betekent ook dat dezelfde prompt op verschillende momenten licht verschillende antwoorden kan geven, tenzij de instellingen het model dwingen altijd de beste keuze te nemen.

Stap 3: Hoe het model leerde behulpzaam te zijn

Pull quote: Het voorspelt plausibele tekst in plaats van exacte feiten op te halen — daarom is het vloeiend, snel en af en toe met overtuiging fout. — Crux Digits

Pure next-token-voorspelling ("pretraining") levert een model op dat tekst kan voortzetten, maar niet per se uw vraag beantwoordt zoals u wilt. Een tweede fase lost dat op.

  • Instructie-afstemming traint het model op voorbeelden van vragen met goede antwoorden, zodat het leert behulpzaam te reageren in plaats van de tekst gewoon voort te zetten.
  • Reinforcement learning met menselijke feedback (RLHF) laat mensen antwoorden beoordelen, en het model wordt bijgestuurd richting de antwoorden die mensen prefereren — helderder, veiliger, nuttiger.

Daarna werkt het model nog steeds via het voorspellen van het volgende token. Het heeft alleen geleerd dat na een vraag het meest plausibele vervolg een behulpzaam antwoord is.

Waarom LLM's soms dingen verzinnen

Omdat het model plausibele tekst voorspelt in plaats van feiten op te halen, genereert het met gemak een zelfverzekerd, goedlopend antwoord, zelfs zonder betrouwbare basis. Een verzonnen bronvermelding of een verkeerd cijfer is voor het model gewoon een reeks waarschijnlijk ogende tokens. Dit heet een hallucinatie — een direct gevolg van hoe het genereren werkt, geen bug die volledig wordt weggepoetst. We gaan er dieper op in bij wat een AI-hallucinatie is.

De praktische les: dat een LLM vloeiend klinkt, bewijst niet dat het klopt. Voor alles wat ertoe doet, heeft het antwoord onderbouwing of een menselijke controle nodig.

Hoe laat u een LLM antwoorden op echte feiten

Standaard kent het model alleen wat het tijdens de training heeft opgenomen — met een afkapdatum en zonder enige kennis van uw eigen documenten. De oplossing is het de feiten te geven op het moment van de vraag, in plaats van te leunen op het geheugen.

  • Retrieval-augmented generation (RAG) doorzoekt uw eigen documenten op de relevante passages en voegt die toe aan de prompt, zodat het model zijn antwoord genereert uit echte, actuele brontekst. Het is de belangrijkste manier om antwoorden accuraat en actueel te maken — zie wat RAG is.
  • Tools en agents laten het model een rekenmachine, een database of een API aanroepen in plaats van te gokken — de basis van agentic AI.

Hoe dan ook verandert het generatiemechanisme niet. U voert het model simpelweg betere context, zodat het meest plausibele vervolg ook het juiste is.

Wat dit betekent als u met LLM's bouwt

Begrijpen hoe next-token-voorspelling werkt, verandert hoe u met deze modellen ontwerpt. U verwacht geen zoekmachine meer, maar behandelt het model als een vloeiende redeneerder die de juiste input en waarborgen nodig heeft.

  • Onderbouw belangrijke antwoorden met uw eigen data (RAG) in plaats van met het geheugen van het model.
  • Houd een mens in de controle waar een fout antwoord echte kosten heeft — juridisch, medisch, financieel.
  • Test tegen echte vragen en verlaag de temperatuur waar consistentie belangrijker is dan creativiteit.

Bij Crux Digits bouwen we precies zulke systemen voor bedrijven in Nederland en heel Europa — onderbouwd, meetbaar en ontworpen rond hoe LLM's echt werken. Overweegt u waar er één kan helpen, dan denkt ons AI-consultancyteam graag mee tijdens een gratis consult.

Veelgestelde vragen

Begrijpen LLM's wat ze zeggen?

Niet in menselijke zin. Een LLM heeft geen overtuigingen, intenties of bewustzijn — het voorspelt statistisch waarschijnlijke tekst. Het kan antwoorden produceren die op begrip lijken omdat het de patronen heeft geleerd van hoe deskundige tekst wordt geschreven, maar het modelleert taal, het begrijpt geen betekenis zoals een mens.

Zoeken LLM's antwoorden op internet op?

Standaard niet. Een gewoon model antwoordt alleen op basis van patronen uit de training, met een vaste afkapdatum en zonder toegang tot uw privé- of actuele data. Het kan het web of uw documenten alleen doorzoeken als het expliciet aan die tools is gekoppeld — bijvoorbeeld via retrieval-augmented generation (RAG) of een zoektool.

Waarom geven LLM's soms foute maar zelfverzekerde antwoorden?

Omdat ze plausibele tekst genereren in plaats van feiten op te halen. Heeft het model geen solide basis, dan produceert het toch het meest waarschijnlijk klinkende vervolg — vloeiend en volledig fout. Dit heet een hallucinatie en wordt het best beperkt door het model te onderbouwen met echte brondata en menselijke controle toe te voegen.

Wat is een token?

Een token is het kleine stukje tekst dat een LLM daadwerkelijk verwerkt — vaak een heel woord, soms een deel van een woord of een leesteken. Modellen lezen en schrijven token voor token, en limieten en prijzen worden in tokens gemeten in plaats van woorden (ruwweg 750 Engelse woorden is ongeveer 1.000 tokens).

Geeft een LLM elke keer hetzelfde antwoord?

Niet per se. Omdat het model uit een kansverdeling kiest, kan dezelfde prompt op verschillende momenten licht verschillende antwoorden geven. De temperatuur op nul (of bijna nul) zetten zorgt dat het bijna altijd het meest waarschijnlijke token kiest, wat veel consistentere, herhaalbare output oplevert.

Hoe laat ik een LLM antwoorden op basis van de informatie van mijn eigen bedrijf?

Koppel het aan uw data in plaats van te leunen op het trainingsgeheugen. De standaardaanpak is retrieval-augmented generation (RAG): het systeem zoekt de relevante passages in uw documenten en voert die aan het model, zodat het antwoord is onderbouwd met uw echte, actuele content. Crux Digits bouwt deze systemen van begin tot eind.

Onze AI-diensten AI-consultants AI-automatisering AI-agents AI-implementatie Prijzen

Iets hiervan toepassen in uw bedrijf?

Wij maken van deze concepten werkende tools — gegrond, veilig en meetbaar. Begin met een gratis consult.

Gratis consult boeken →