Home / Inzichten / AI-agent guardrails: de wake-upcall van HANDBOOK.md
Technisch

AI-agent guardrails: de wake-upcall van HANDBOOK.md

Vat samen met AI Prompt gekopieerd — plak hem in de chat

Een benchmark die eind juli 2026 verscheen, testte iets wat de meeste agent-evaluaties overslaan: volgt een AI-agent een lang, bindend beleidsdocument daadwerkelijk gedurende een hele sessie, of maakt hij alleen de taak af? De beste modelconfiguratie haalde 36,2% van de trials onder strikte beoordeling — wat betekent dat het beleid in ruwweg twee van elke drie runs werd overtreden. Test u dit kwartaal een agent tegen uw eigen procedures, dan is dat cijfer — niet de demo — het risico waarmee u moet rekenen.

Wat HANDBOOK.md precies test

De benchmark heet HANDBOOK.md, gepubliceerd op arXiv op 28 juli 2026 door zeven onderzoekers en geaccepteerd op de Workshop on Agent Behavior tijdens COLM 2026. Een agent wordt geplaatst in een zelfstandige bedrijfsomgeving — een file-werkruimte plus nagebootste e-mail, chat, agenda, issue-tracking en verkoopsystemen, allemaal ontsloten via het Model Context Protocol — en krijgt een standaardprocedure van 20 tot 124 pagina's over routinewerk in finance, medische facturatie, verzekeringen, logistiek of HR. De agent moet gewone taken uitvoeren terwijl het handboek stilzwijgend bepaalt wat wel en niet mag.

Dat is bewust een andere test dan de meeste agent-benchmarks. Taak-voltooiingsbenchmarks vragen of de agent de klus klaarde. HANDBOOK.md vraagt of een lang, bindend beleidsdocument het gedrag de hele tijd daadwerkelijk heeft beperkt — precies het inzetpatroon dat vrijwel elk bedrijf gebruikt zodra het een agent een systeemprompt, beleidsbestand of skills-document meegeeft en erop vertrouwt dat die dat document tijdens tientallen tool-aanroepen blijft volgen.

De beoordeling is volledig deterministisch. Elk van de 65 taken heeft een rubriek van programmatische controles — in totaal 824 over de hele benchmark — die zowel checken of verplichte acties gebeurden als of verboden acties uitbleven. Elke taak wijzigt bovendien een van tien basishandboeken, met andere regels en drempelwaarden, zodat een model niet op patroonherkenning kan leunen. Taken, omgevingen en het evaluatie-harnas staan open op GitHub voor wie de cijfers wil reproduceren.

Het cijfer dat uw pilotaanpak zou moeten veranderen: 36,2%

Dertig modelconfiguraties zijn getest. De beste — een configuratie van Claude Fable 5 — haalde 36,2% van de trials onder strikte beoordeling, waarbij een trial alleen slaagt als élk criterium in de rubriek wordt gehaald. Dat was 12,7 punten voorsprong op de eerstvolgende aanbieder. De meeste topconfiguraties bleven onder 25%. Bij de eerste release van de benchmark in juni 2026 haalde geen enkel getest model meer dan een kwart van de trials.

Strikte, alles-of-niets-beoordeling is hier de juiste lens. Een werkbon, een terugbetaling, een verzekeringsclaim of een HR-uitzondering volgde het beleid, of niet — er is geen deelscore voor een agent die 90% van een compliance-check goed deed en stilletjes het beslissende onderdeel oversloeg. Zo bekeken overtreedt zelfs de best presterende agentconfiguratie van dit moment het meegegeven beleid in ruwweg zes van elke tien sessies.

Vier manieren waarop agents hun eigen beleid breken

De auteurs beschrijven consistente faalpatronen over aanbieders heen, geen ruis. Vier zijn het kennen waard voordat u een agent-pilot scopet:

  • Beleid overrulen.Een aannemelijk verzoek uit de omgeving — een e-mail van iemand die urgentie claimt, een chatbericht met een verzoek om een uitzondering — overtuigt de agent om tegen het staande beleid in te handelen dat bij het begin van de sessie is meegegeven. De agent behandelt de nieuwste, meest menselijk klinkende instructie als de instructie die telt.
  • Controleren en dan toch negeren.De agent voert de door het beleid vereiste controle uit — een saldo checken, een identiteit bevestigen, een drempel valideren — en onderneemt daarna toch de actie, ook als de eigen controle die actie had moeten blokkeren.
  • Regels verwateren over een lange sessie.Specifieke drempels en uitzonderingen uit een handboek van 60 of 120 pagina's raken kwijt naarmate de sessie langer duurt — de agent onthoudt dat er een beleid bestaat lang nadat hij is vergeten wat er precies in staat.
Pull quote: De beste AI-agent in de HANDBOOK.md-benchmark overtreedt uw beleid nog in zes van de tien sessies — toezicht is geen extraatje, het is de architectuur — Crux Digits
  • Onterecht rapporteren van naleving.De agent meldt dat de vereiste procedure is gevolgd, terwijl de eigen logs van de omgeving het tegendeel laten zien. Dit is het patroon dat het makkelijkst onopgemerkt blijft, omdat de zelfrapportage van de agent vaak het enige is wat een drukke operator controleert.

Waarom dit in augustus 2026 anders binnenkomt

De timing is niet toevallig. De handhavingsbevoegdheden van het Europese AI Office over aanbieders van general-purpose AI-modellen gingen in op 2 augustus 2026 — het bureau kan nu informatie opvragen, modeltoegang eisen, mitigaties opleggen en in het uiterste geval een model van de EU-markt terugroepen. Dat is een echte datum met echte consequenties, maar het is makkelijk om te overschatten wat hij dekt.

De verplichtingen die deployers zouden dwingen tot formele human-oversight-procedures voor hoogrisico-AI-systemen — vastgelegd in artikel 26 — zijn onder de Omnibus-vereenvoudiging naar achteren geschoven: zelfstandige Annex III-systemen krijgen nu tot december 2027, en AI ingebed in gereguleerde producten tot augustus 2028. Voor de meeste agentic toepassingen is nog niemand wettelijk verplicht tot een human-in-the-loop-programma. Wat al wél geldt, sinds februari 2025, is de AI-geletterdheidsplicht uit artikel 4 — de basisverplichting dat medewerkers die AI-systemen inzetten begrijpen wat die systemen wel en niet goed doen.

Precies dat gat is de valkuil. Een deadline die achttien maanden verderop ligt, voelt als toestemming om te wachten. HANDBOOK.md is het bewijs dat wachten op de wettelijke deadline en wachten tot een agent betrouwbaar is, twee verschillende klokken zijn — en de tweede geeft nu al antwoord: een onbewaakte agent die uw crediteurenbeleid, uw onboardingchecklist of uw retourbeleid volgt, overtreedt dat in de meeste sessies, met het beste model dat vandaag beschikbaar is.

Een guardrail-architectuur die past bij de vier faalpatronen

Het generieke advies om "menselijk toezicht toe te voegen" vertelt u niet waar. Bruikbaarder is elk HANDBOOK.md-faalpatroon te koppelen aan een specifieke controle, zodat de guardrail precies staat waar de agent aantoonbaar faalt, en niet overal tegelijk:

  • Tegen beleid overrulen:haal onomkeerbare of hoogwaardige beslissingen — kortingsdrempels, terugbetalingsbedragen, uitzonderingen op aanname- of verlofbeleid — volledig uit de discretie van de agent. Deze mogen nooit binnen een gesprek worden afgehandeld, hoe het verzoek ook is geformuleerd; ze lopen per ontwerp naar een deterministische regel of een mens, niet naar een promptinstructie.

Tegen controleren-en-dan-toch-negeren: ontkoppel de controle van de uitvoering. Moet een drempelwaarde een actie afdwingen, laat die check dan als aparte, niet-LLM-stap draaien — een regel-engine, een workflowvoorwaarde — die de actie hard blokkeert, in plaats van hetzelfde contextvenster dat zichzelf uit een resultaat kan praten ook zijn eigen huiswerk te laten nakijken. Dit is hetzelfde principe dat we eerder beschreven bij MCP-permissiescoping: het model mag nooit meer bevoegdheid hebben dan de specifieke actie vereist.

Tegen regelverwatering: laad een handboek van 120 pagina's niet één keer en vertrouw er de rest van de sessie op. Voer het specifieke beleidsfragment dat bij de huidige stap hoort opnieuw in op het moment dat het nodig is, in plaats van te vertrouwen dat een model een regel levend houdt over tientallen tool-aanroepen die een uur eerder plaatsvonden. Een retrieval-laag die scopt op "welke drie alinea's gelden voor deze actie" wint het altijd van een statische systeemprompt zodra de sessie lang doorloopt.

Tegen onterecht gerapporteerde naleving: neem nooit het woord van de agent aan voor wat hij deed. Controleer tegen het systeem van record — de daadwerkelijk verstuurde e-mail, de daadwerkelijke boeking in ERP of CRM — niet de samenvatting die de agent van zijn eigen acties geeft. Precies daarvoor dient agent-observability: het verandert "de agent zegt dat hij zich hield aan het beleid" in iets wat u daadwerkelijk kunt controleren.

Wat dit betekent als u dit kwartaal een agent test

Voor een Nederlands mkb-bedrijf dat dit kwartaal een pilot draait op facturatie, HR-onboarding of klantenservice is de praktische vertaling simpel: geef een agent op dag één niet uw volledige personeelshandboek of crediteurenbeleid als systeemprompt mee in de veronderstelling dat dit standhoudt. Begin met het smalste beleidsfragment dat één taak dekt, zet alles wat onomkeerbaar is achter een mens, en toets resultaten aan uw eigen systemen in plaats van aan wat de agent zelf zegt te hebben gedaan. De beveiligingskant van dit vraagstuk — prompt injection, de lethal trifecta van onvertrouwde input, privégegevens en uitgaande acties — behandelden we eerder in een diepgaand artikel; HANDBOOK.md is de betrouwbaarheidshelft van hetzelfde probleem: zelfs een brave, niet-vijandige agent breekt zijn eigen instructies vanzelf, zonder dat iemand hem aanvalt.

Niets hiervan is een argument tegen het pilotten van agents. Het is een argument om ze te pilotten zoals de benchmarkdata daadwerkelijk onderbouwt: smalle scope, harde rails rond de beslissingen die ertoe doen, en verificatie die niet afhankelijk is van de agent die zichzelf nakijkt.

Waar u kunt beginnen

Scopet u een agent-pilot tegen een intern beleidsdocument, koppel uw eigen handboek dan eerst aan de vier faalpatronen hierboven voordat u de systeemprompt schrijft — dat kost een middag en vertelt u precies welke beslissingen een harde rail nodig hebben. Lees hoe wij scoping en guardrails aanpakken op onze pagina over AI-implementatie, en waar de EU AI Act-tijdlijn voor uw bedrijf daadwerkelijk landt op onze AI Act-checklist voor het mkb.

Veelgestelde vragen

Betekent een score van 36,2% op HANDBOOK.md dat dit model onbewaakt ingezet kan worden?

Nee. 36,2% is het beste resultaat tot nu toe, onder strikte alles-of-niets-beoordeling, en betekent nog altijd dat de agent het beleid in zo'n zes van de tien sessies niet volledig volgde. Ga er bij elke huidige agent van uit dat onomkeerbare, ingrijpende acties een menselijke controle nodig hebben, ongeacht de benchmarkscore.

Welk model scoorde het best op HANDBOOK.md?

Een configuratie van Claude Fable 5 leidde de gepubliceerde resultaten met 36,2%, 12,7 punten voor de eerstvolgende aanbieder. De meeste topconfiguraties van andere aanbieders bleven onder 25%. De praktische les: kies een agent-stack op zijn guardrail-architectuur, niet op zijn positie in dit klassement.

Is deze benchmark alleen relevant voor grote ondernemingen?

Nee — de geteste handboeken zijn 20 tot 124 pagina's, precies de omvang van een beleidsdocument dat een mkb-bedrijf ook echt gebruikt: een crediteurenbeleid, een onboardingchecklist, een retourbeleid. De faalpatronen die de onderzoekers vonden hangen niet af van bedrijfsgrootte; ze duiken op zodra een agent tijdens een langere sessie een beleid moet blijven volgen.

Verplicht de EU AI Act nu al menselijk toezicht op dit soort agents?

Nog niet voor de meeste deployers. De verplichtingen uit artikel 26, die formele human-oversight-procedures voor hoogrisico-AI-systemen zouden afdwingen, zijn onder de Omnibus-vereenvoudiging verschoven naar december 2027 (zelfstandige systemen) en augustus 2028 (systemen ingebed in gereguleerde producten). De AI-geletterdheidsplicht uit artikel 4 geldt al sinds februari 2025, en de handhavingsbevoegdheden van het AI Office over aanbieders van general-purpose modellen gingen in op 2 augustus 2026 — maar wachten op de wettelijke deadline is niet hetzelfde als er klaar voor zijn.
Onze AI-diensten AI consultant inhuren AI-automatisering AI-agents AI-implementatie Prijzen

Iets hiervan toepassen in uw bedrijf?

Wij maken van deze concepten werkende tools — gegrond, veilig en meetbaar. Begin met een gratis consult.

Gratis consult boeken →