Home / AI-begrippenlijst / Wat is RAG (retrieval-augmented generation)?
AI-begrippenlijst

Wat is RAG (retrieval-augmented generation)?

RAG laat een taalmodel uw eigen documenten opzoeken tijdens het antwoorden, zodat antwoorden gegrond en actueel blijven.

In het kort

RAG geeft een groot taalmodel toegang tot uw eigen documenten op het moment van antwoorden. Het haalt de meest relevante passages uit uw kennisbank en voert die aan het model, zodat antwoorden gegrond zijn in uw data — met bronnen — in plaats van alleen de training van het model. Het is de belangrijkste techniek om hallucinaties te verminderen. Bekijk LLM-optimalisatie →

RAG (retrieval-augmented generation) laat een taalmodel op het moment van antwoorden uw eigen documenten doorzoeken en het antwoord schrijven uit wat het vindt. Het model levert de taal; uw content levert de feiten.

Het lost één probleem op: een model kent alleen wat in zijn trainingsdata zat, en daar staan uw prijzen, beleid en productdetails nooit in. RAG dicht dat gat zonder iets te hertrainen, u werkt het document bij, en het antwoord verandert mee.

In Vlaanderen spreekt men meestal van artificiële intelligentie, in Nederland van kunstmatige intelligentie. Hetzelfde begrip, alleen de gangbare spelling verschilt per regio.

Hoe RAG werkt, in vier stappen

Uw documenten worden opgeknipt in stukken en omgezet naar embeddings in een vectorindex. Komt er een vraag binnen, dan wordt die op dezelfde manier omgezet en worden de dichtstbijzijnde stukken opgehaald. Die stukken gaan als context mee in de prompt. Het model genereert daaruit een antwoord, idealiter met bronvermelding. De meeste RAG-kwaliteitsproblemen zijn zoekproblemen, geen modelproblemen.

RAG versus fine-tuning versus long-context

Deze drie lossen verschillende problemen op en worden voortdurend verward. RAG levert feiten en houdt ze actueel. Fine-tuning leert stijl, vorm en toon, een slechte en dure manier om feiten te leren, want feiten veranderen. Long-context betekent alles in de prompt plakken: het simpelst te bouwen, maar kosten en latency schalen met elke aanroep. Vuistregel: veranderende feiten → RAG; vaste uitvoervorm → fine-tuning; kleine vaste documentset → long-context.

Wanneer u RAG niet nodig heeft

Is uw kennisbank een handvol pagina's die zelden verandert, dan is long-context eenvoudiger en vaak beter. Gaat het om samenvatten of herschrijven van tekst die de gebruiker zelf aanlevert, dan valt er niets op te halen. En zijn uw documenten tegenstrijdig of verouderd, dan haalt RAG dat trouw naar boven, het is een zoeksysteem, geen feitenchecker. Repareer eerst de content.

Hoe u weet of het werkt

Meet het zoeken, niet het gevoel. Bouw een evaluatieset met echte vragen waarvan u de juiste bron kent, en controleer hoe vaak het juiste stuk überhaupt wordt opgehaald, wordt het niet opgehaald, dan kan het model het niet gebruiken. Vraag elke leverancier naar zoeknauwkeurigheid op uw documenten in plaats van een benchmark. Bij Crux Digits valt een RAG-pilot binnen de Productieklare MVP van €20.000, opgeleverd in 4–6 weken.

Veelgestelde vragen

Wat is RAG in eenvoudige taal?

Het laat een AI dingen opzoeken in uw documenten voordat hij antwoordt. In plaats van te leunen op wat het model tijdens training onthield, doorzoekt het systeem uw content, vindt de relevante passages en schrijft het antwoord daaruit: meestal met een bronvermelding erbij.

  • Het praktische voordeel: werk een document bij en het antwoord verandert direct mee, zonder hertrainen.
  • Bronvermelding maakt antwoorden controleerbaar, wat telt bij beleid, prijzen en garantie.
  • RAG vermindert hallucinatie flink maar haalt het niet weg, houd een menselijke escalatieroute open.

Moeten we RAG of fine-tuning gebruiken?

RAG voor feiten, fine-tuning voor stijl. Moet de AI uw prijzen, beleid of producten kennen, kies dan RAG, die veranderen, en telkens hertrainen is onwerkbaar. Heeft u consistente toon of een strak uitvoerformaat nodig, dan helpt fine-tuning. Veel productiesystemen gebruiken beide.

  • Fine-tuning is een slechte manier om feiten te leren: het model kan niet zeggen uit welke bron een antwoord komt.
  • RAG is meestal goedkoper te bouwen en veel goedkoper actueel te houden.
  • Een derde optie, long-context, verslaat beide als uw documentset klein en stabiel is.

Hebben we genoeg documenten om RAG te laten werken?

Meestal wel, kwaliteit weegt veel zwaarder dan aantal. Een paar honderd kloppende, actuele pagina's presteren beter dan duizenden tegenstrijdige. De echte voorwaarde is dat uw content juist en consistent is, want RAG haalt trouw op wat er staat, inclusief verouderd beleid.

  • Goede bronnen: productdocumentatie, beleid, prijslijsten, eerdere supporttickets, handboeken.
  • Ruim tegenstrijdigheden op vóór de bouw. RAG maakt ze zichtbaar in plaats van ze op te lossen.
  • Houd de index gesynchroniseerd met de levende bron, anders citeert de assistent de versie van vorig jaar.
Verder bij Crux Digits

Wilt u dit toepassen in uw bedrijf? Bekijk hoe wij het naar productie brengen:

← Alle AI-begrippen

Van concept naar werkende tool?

Wij bouwen deze AI in productie, met vaste prijzen en een vaste expert. Begin met een gratis consult.

Gratis consult boeken →