RAG laat een taalmodel uw eigen documenten opzoeken tijdens het antwoorden, zodat antwoorden gegrond en actueel blijven.
RAG geeft een groot taalmodel toegang tot uw eigen documenten op het moment van antwoorden. Het haalt de meest relevante passages uit uw kennisbank en voert die aan het model, zodat antwoorden gegrond zijn in uw data — met bronnen — in plaats van alleen de training van het model. Het is de belangrijkste techniek om hallucinaties te verminderen. Bekijk LLM-optimalisatie →
RAG (retrieval-augmented generation) laat een taalmodel op het moment van antwoorden uw eigen documenten doorzoeken en het antwoord schrijven uit wat het vindt. Het model levert de taal; uw content levert de feiten.
Het lost één probleem op: een model kent alleen wat in zijn trainingsdata zat, en daar staan uw prijzen, beleid en productdetails nooit in. RAG dicht dat gat zonder iets te hertrainen, u werkt het document bij, en het antwoord verandert mee.
In Vlaanderen spreekt men meestal van artificiële intelligentie, in Nederland van kunstmatige intelligentie. Hetzelfde begrip, alleen de gangbare spelling verschilt per regio.
Uw documenten worden opgeknipt in stukken en omgezet naar embeddings in een vectorindex. Komt er een vraag binnen, dan wordt die op dezelfde manier omgezet en worden de dichtstbijzijnde stukken opgehaald. Die stukken gaan als context mee in de prompt. Het model genereert daaruit een antwoord, idealiter met bronvermelding. De meeste RAG-kwaliteitsproblemen zijn zoekproblemen, geen modelproblemen.
Deze drie lossen verschillende problemen op en worden voortdurend verward. RAG levert feiten en houdt ze actueel. Fine-tuning leert stijl, vorm en toon, een slechte en dure manier om feiten te leren, want feiten veranderen. Long-context betekent alles in de prompt plakken: het simpelst te bouwen, maar kosten en latency schalen met elke aanroep. Vuistregel: veranderende feiten → RAG; vaste uitvoervorm → fine-tuning; kleine vaste documentset → long-context.
Is uw kennisbank een handvol pagina's die zelden verandert, dan is long-context eenvoudiger en vaak beter. Gaat het om samenvatten of herschrijven van tekst die de gebruiker zelf aanlevert, dan valt er niets op te halen. En zijn uw documenten tegenstrijdig of verouderd, dan haalt RAG dat trouw naar boven, het is een zoeksysteem, geen feitenchecker. Repareer eerst de content.
Meet het zoeken, niet het gevoel. Bouw een evaluatieset met echte vragen waarvan u de juiste bron kent, en controleer hoe vaak het juiste stuk überhaupt wordt opgehaald, wordt het niet opgehaald, dan kan het model het niet gebruiken. Vraag elke leverancier naar zoeknauwkeurigheid op uw documenten in plaats van een benchmark. Bij Crux Digits valt een RAG-pilot binnen de Productieklare MVP van €20.000, opgeleverd in 4–6 weken.
Het laat een AI dingen opzoeken in uw documenten voordat hij antwoordt. In plaats van te leunen op wat het model tijdens training onthield, doorzoekt het systeem uw content, vindt de relevante passages en schrijft het antwoord daaruit: meestal met een bronvermelding erbij.
RAG voor feiten, fine-tuning voor stijl. Moet de AI uw prijzen, beleid of producten kennen, kies dan RAG, die veranderen, en telkens hertrainen is onwerkbaar. Heeft u consistente toon of een strak uitvoerformaat nodig, dan helpt fine-tuning. Veel productiesystemen gebruiken beide.
Meestal wel, kwaliteit weegt veel zwaarder dan aantal. Een paar honderd kloppende, actuele pagina's presteren beter dan duizenden tegenstrijdige. De echte voorwaarde is dat uw content juist en consistent is, want RAG haalt trouw op wat er staat, inclusief verouderd beleid.
Wilt u dit toepassen in uw bedrijf? Bekijk hoe wij het naar productie brengen:
Wij bouwen deze AI in productie, met vaste prijzen en een vaste expert. Begin met een gratis consult.
Gratis consult boeken →