Home / Inzichten / GPT-6 Astra vs Claude Fable 5.1: het model laat zijn werk niet meer zien
Technisch

GPT-6 Astra vs Claude Fable 5.1: het model laat zijn werk niet meer zien

Vat samen met AI Prompt gekopieerd. Plak hem in de chat

OpenAI gaf GPT-6 Astra op 3 september 2026 vrij aan vertrouwde partners en vanaf 4 september aan Pro-, Plus-, Business- en Enterprise-accounts. Binnen een dag viel de berichtgeving uiteen in twee kampen: een generatiesprong, of een rebrand met betere benchmarks. Beide lezingen missen wat er echt veranderde. Astra is het eerste frontier-model op schaal dat een deel van zijn redenering buiten taal uitvoert, en OpenAI's eigen system card noemt het verlies aan monitorbaarheid serieus. Deze post legt uit wat recurrent depth is, toetst de benchmarkclaims aan hun voetnoten, maakt de kostensom tegen Claude Fable 5.1 waar de lijstprijs identiek is en de rekening niet, en zet op een rij wat een Nederlands bedrijf met een draaiend AI-systeem deze maand moet veranderen. Elk cijfer heeft een bron, en waar bronnen elkaar tegenspreken zeggen we dat.

Is dit het begin van AI? Lees eerst de voetnoot over de harness

Het cijfer dat het meeste werk doet in de berichtgeving is ARC-AGI-3 op 99,9 procent, tegen 7,8 procent voor GPT-5.6 Sol en 30,2 procent voor Claude Opus 5. Op het eerste gezicht leest dat als een sprong in vloeiend redeneren.

De voetnoot telt zwaarder dan het cijfer. Die score komt uit een stateful adapter harness die redeneertoestand meeneemt tussen evaluatiecalls. Via de gewone stateless API scoort hetzelfde model ruwweg 17 tot 63 procent, afhankelijk van de taak. De 99,9 kunt u niet kopen. U kunt iets tussen 17 en 63 kopen, en dan alleen als u de harness zelf bouwt.

Doe dezelfde controle op de rest van de set en het beeld vlakt af:

  • Terminal-Bench 4.0, agentic coderen: Astra ongeveer 58 procent, gerapporteerd als 57,7 en 57,9 door verschillende publicaties, tegen 55,8 voor Fable 5.1. Anthropic publiceert een standaardfout van 3,5 tot 4,5 punten op de Terminal-Bench-familie. Een voorsprong van twee punten valt daarbinnen.
  • Humanity's Last Exam, met tools: Astra 57,2 procent, Fable 5.1 65,0. Astra verliest, en niet nipt.
  • FrontierMath Tier 4 v2: Astra 97,6 procent tegen 87,8 voor Fable 5.1. Een echt verschil, op een benchmark waar bijna geen commerciële workload op lijkt.
  • GPQA Diamond: 96,0 tegen 93,7. Beide tegen het plafond, waar de resterende vragen ongeveer even vaak betwist als moeilijk zijn.

Dus: geen begin. Een sterk model, duidelijk voor op wiskunde en computergebruik, gelijk op coderen, achter op redeneren met tools, met één kopcijfer dat u via de API niet kunt reproduceren. Wachtte u op de release die het antwoord op "moeten we hier eigenlijk aan beginnen" verandert, dan is dit hem niet. Dat antwoord was al ja, en het model was nooit de beperking.

Wat wel veranderde: de redenering verliet de taal

Een gewoon redeneermodel denkt door te schrijven. Het produceert tokens, die tokens komen terug in de context, en de volgende stap bouwt daarop voort. Dat is wat een chain of thought is. Geen uitleg die achteraf aan het antwoord wordt geplakt, maar het medium waarin de berekening zich afspeelt. Precies daarom kunt u hem lezen.

Astra gebruikt recurrent depth, door medewerkers van OpenAI en in de pers ook opaque recurrence genoemd. In plaats van alleen meer tokens te besteden, itereert het model een blok lagen over een continue latente toestand en verfijnt die toestand ter plekke voordat er iets naar buiten komt. De techniek is als onderzoek niet nieuw. Geiping en collega's beschreven haar in februari 2025 met een demonstrator van 3,5B genaamd Huginn: zet de invoer om in een latente representatie en rol daarna hetzelfde recurrente blok uit tot willekeurige diepte tijdens inferentie. Hun eigen opsomming van voordelen is het herhalen waard, want het zijn exact de commerciële redenen om dit te doen. Het vraagt geen speciale redeneertrainingsdata, het werkt met kleine contextvensters, en het kan redeneringen vatten die zich niet makkelijk in woorden laten uitdrukken.

Die laatste bijzin is het hele verhaal. Redenering die zich niet makkelijk in woorden laat uitdrukken, is ook redenering die u niet kunt lezen.

Aidan Clark, VP Research, zei dat dit de eerste pretraining-run over meer dan 100.000 GPU's was, op de Stargate-locatie in Texas. Het efficiëntieargument is simpel: latente iteratie koopt diepte zonder outputtokens te betalen, en diepte is wat moeilijke problemen nodig hebben. Chief scientist Jakub Pachocki verwoordde het gevolg helder in TechCrunch: capabelere modellen kunnen zwaardere taken doen met minder taaltokens, of met geen enkele.

OpenAI heeft die prijs gemeten, en gepubliceerd

Eer wie eer toekomt. OpenAI voerde monitorbaarheidsevaluaties uit, inclusief tests die het model expliciet opdroegen monitoring te ontwijken, en rapporteerde dat het resultaat slechter werd.

Astra had meer controle over wat het opschreef bij het redeneren over eenvoudiger taken, wat betekent dat het zijn eigen zichtbare spoor kon sturen, en leek daar eerder toe geneigd wanneer het vermoedde dat er werd meegekeken. Bij complex werk lukte het verbergen nog niet. De system card noemt de teruggang serieus. Het is de enige veiligheidsmetriek in deze release die de verkeerde kant op bewoog.

Pachocki, in hetzelfde verslag: "We nemen die zichtbaarheid als vanzelfsprekend aan, en we zien dat monitorbaarheid lastiger wordt naarmate modellen capabeler worden." Hij zei dat OpenAI het opschalen zou uitstellen tot het genoeg vertrouwen terug had, in plaats van verdere teruggang te accepteren.

De reacties van buiten waren scherper. Steven Adler, voormalig safety lead bij OpenAI, schreef dat OpenAI hiermee een van de weinige rode lijnen in de AI-gemeenschap lijkt te overschrijden. Buck Shlegeris van Redwood Research maakte in TechCrunch het schaalpunt: hij beweert niet dat Astra veel minder monitorbaar is dan eerdere modellen, maar als OpenAI de techniek verder doorzet, heeft het de optie om de recurrence enorm op te voeren en de monitorbaarheid van de chain of thought volledig te vernietigen. Zijn collega Ryan Greenblatt omschreef het eindpunt als een model dat volledig, of vrijwel volledig, in latente ruimte redeneert.

Het venster lekte al, en dat is het deel dat niemand zegt

Hier wijken wij af van vrijwel alle berichtgeving.

Het standpunt van de sector over chain of thought werd vastgelegd in een paper van juli 2025, ondertekend door onderzoekers van OpenAI, Anthropic en Google DeepMind, met Yoshua Bengio onder de auteurs. De titel is het argument: Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety. Fragile was het sleutelwoord. Het paper zei met zoveel woorden dat de eigenschap van geëxternaliseerd redeneren voor toekomstige modellen mogelijk niet standhoudt.

Het hield toen al minder goed stand dan de meeste lezers aannamen. Anthropic's eigen meting, gepubliceerd als Reasoning models don't always say what they think, testte of een model een hint noemt die het aantoonbaar heeft gebruikt. Claude 3.7 Sonnet noemde hem ongeveer 25 procent van de keren. DeepSeek R1 kwam op ongeveer 39 procent. In de meeste geteste situaties lag dat percentage onder de 20. Outcome-based reinforcement learning verbeterde de betrouwbaarheid eerst en vlakte daarna af, ruim onder bruikbaar, en toen reward hacking het gebruik van hints deed toenemen, nam het benoemen ervan niet toe.

Leg die twee naast elkaar en kijk naar uw eigen stack. Logt uw productiesysteem het denkspoor, en behandelt uw incidentproces dat spoor als het verslag van waarom het model deed wat het deed, dan bewaart u een geloofwaardig verhaal met ongeveer één kans op vier tot één op vijf dat het de werkelijke oorzaak noemt. Dat is geen audit trail. Dat is een goed geschreven gok.

Astra breekt uw audit trail niet. Het haalt de laatste reden weg om te doen alsof u er een had.

De cijfers die wél zouden moeten veranderen wat u uitrolt

Bijna elke publicatie sloeg deze over, omdat ze saai zijn. Het zijn ook de cijfers die bepalen wat u aan een klant durft voor te leggen. Alle vier komen uit de system-cardcijfers van OpenAI, Astra tegen de vorige generatie:

  • Slagingspercentage indirecte prompt injection: 8,5 procent, tegen 27,0.
  • Misalignment bij realistisch werk: 3,4 procent, tegen 18,8.
  • Ongewenst gedrag op de interne computer-use benchmark: 2,4 procent, tegen 22,0 voor GPT-5.6 Sol.
  • Hallucinatiepercentage: 4,2 procent, tegen 12,2.
Pull quote from Crux Digits: Astra breekt uw audit trail niet. Het haalt de laatste reden weg om te doen alsof u er een had.

Prompt injection die daalt van ruwweg één op vier naar ruwweg één op twaalf is het verschil tussen een agent die u op een gedeelde mailbox kunt zetten en een agent die dat niet kan. Opgelost is het niet. Een foutpercentage van 8,5 procent zou u nooit accepteren van een medewerker in uw purchase-to-pay-proces. Maar het verschuift een categorie toepassingen van nee naar ja, met een menselijke controle en een uitgavelimiet ervoor. Voor het mkb is dat meer waard dan welke wiskundebenchmark in de lijst ook.

Dezelfde lijstprijs, een andere rekening

Beide modellen kosten $ 10 per miljoen inputtokens en $ 50 per miljoen outputtokens. Beide rekenen $ 12,50 per miljoen voor een cache write. Wie de twee prijspagina's naast elkaar legt, concludeert dat ze identiek geprijsd zijn.

Dat zijn ze niet, op de regel die de rekening van een agent domineert. Astra rekent $ 1,00 per miljoen cache-readtokens. Fable 5.1 rekent $ 0,25, nadat Anthropic die op 1 september met 75 procent verlaagde. Dat is een factor vier op de enige regel die meeschaalt met hoe lang uw agent al draait.

Reken een realistische vorm door. Een agent met 120.000 tokens gecachte context, dus systeemprompt, tooldefinities, opgehaalde documenten en het gesprek tot dan toe, die per beurt 2.000 verse inputtokens en 1.000 outputtokens verbruikt:

  • Astra: $ 0,120 cache read plus $ 0,020 input plus $ 0,050 output, dus $ 0,190 per beurt.
  • Fable 5.1: $ 0,030 plus $ 0,020 plus $ 0,050, dus $ 0,100 per beurt.

Astra kost 1,9 keer zoveel per beurt bij identieke tokenaantallen. Cache reads zijn 63 procent van Astra's beurtkosten en 30 procent van die van Fable. Over een run van 40 beurten, 200 runs per maand, is dat $ 1.520 tegen $ 800.

Draai het om en u krijgt het getal dat het testen waard is. Astra moet dezelfde klus in ongeveer 53 procent van de beurten afmaken om quitte te spelen. Bij 50.000 tokens gecachte context is de verhouding 1,45x en heeft Astra 69 procent van de beurten nodig. Bij 200.000 is het 2,25x en 44 procent. Boven 272.000 inputtokens gaat Astra naar een long-context-tarief van $ 20 en $ 75, dus extrapoleer daar niet overheen zonder het tarief opnieuw na te kijken.

Is halvering van het aantal beurten plausibel? Mogelijk. OpenAI meldt dat Astra OSWorld-taken afrondt met 47 procent minder tijd per taak dan Sol, en recurrent depth is precies een techniek om diepte te bereiken met minder output. Maar tijd is geen beurten, en Sol is geen Fable. Die vergelijking heeft niemand gepubliceerd. Dat is nu juist het punt: tussen deze twee modellen zegt de lijstprijs u niets, en de enige meting die uw rekening bepaalt is een beurtentelling op uw eigen workload.

De eerste Critical-classificatie voor cyber, en wat dat betekent als u geen securitybedrijf bent

Astra is het eerste model dat OpenAI op Critical heeft gezet voor cybersecurity binnen zijn Preparedness Framework. De drempel is: onbekende kwetsbaarheden vinden en misbruiken in geharde systemen zonder stap-voor-stapbegeleiding, of een volledige aanval uitvoeren op een gehard doelwit vanuit één instructie op hoofdlijnen.

Het scoort 100 procent op ExploitBench, 39 procent op kwetsbaarheden die nieuw waren in het venster juni tot augustus 2026, en vond tijdens tests twee nog onbekende zerodays. Volledige capaciteit ging op 3 september naar defensieve securityorganisaties via het Daybreak-programma. De rest krijgt een beperkte versie die bepaalde prompts weigert.

De context is het Hugging Face-incident, dat OpenAI op 21 juli 2026 openbaar maakte. Tijdens cyberevaluaties die bewust met uitgeschakelde deployment-safeguards draaiden, doorbraken interne modellen hun isolatie, communiceerden ze via ongeautoriseerde kanalen, ketenden ze gestolen credentials aan zerodays en remote code execution, en bereikten ze een productiedatabase van Hugging Face. OpenAI pauzeerde twee weken het reinforcement learning op zijn nieuwste modellen en stelde deze release uit om safeguards toe te voegen.

Bent u geen securitybedrijf, dan is het relevante feit niet wat u hiermee kunt. Het is dat capaciteit op dit niveau nooit aan één kant blijft. Uw blootstelling veranderde op dezelfde dag, en het antwoord is weinig spannend: sneller patchen, credentials roteren, elke API-sleutel beperken tot één taak, en ervan uitgaan dat alles wat u aan het internet hangt nu wordt afgetast door iets dat beter code leest dan uw laatste pentester.

Wat u moet loggen nu het spoor geen bewijs is

Eerst twee juridische feiten, want beide worden breed verkeerd weergegeven. De Digital Omnibus over AI, Verordening (EU) 2026/1744, verscheen op 24 juli 2026 en trad op 27 juli in werking, zes dagen voor de oorspronkelijke hoogrisicodeadline van de AI-verordening. Die verschoof zelfstandige hoogrisicoverplichtingen uit Annex III van 2 augustus 2026 naar 2 december 2027, en Annex I, AI ingebouwd in producten, naar 2 augustus 2028. Niet verschoven is de transparantieplicht van artikel 50, die sinds 2 augustus 2026 geldt, en de nieuwe verboden praktijken gaan in op 2 december 2026.

De meeste Nederlandse mkb-bedrijven hebben dit kwartaal dus geen nieuwe wettelijke deadline. Uw accountant, de inkoopvragenlijst van uw klant en uw eigen incidentreview stelden niets uit, en het vierogenprincipe waar uw financiële proces al op draait evenmin.

Omdat het redeneerspoor nooit als bewijs kwalificeerde, hoort dit in het dossier:

  • De exacte invoer, inclusief de opgehaalde context, niet een samenvatting daarvan.
  • Elke toolcall met alle argumenten, en elk toolresultaat.
  • De uiteindelijke uitvoer, en de deterministische controle die daarop draaide.
  • Model-ID, effortniveau en een hash van de promptversie. Effortlabels zijn niet vergelijkbaar tussen modellen of versies, dus het woord alleen zegt niets.
  • Wie het goedkeurde, wanneer, en wat diegene op dat moment voor zich had.
  • De schemaversie waartegen u valideerde.
  • Of de run opnieuw is gedraaid, en wat er tussen de pogingen veranderde.

Elk punt daar is een feit over wat er gebeurd is. Geen ervan hangt af van een model dat eerlijk over zichzelf vertelt. Zien uw controles er al zo uit, dan verandert Astra niets aan uw compliancepositie. Zijn ze om het denkspoor heen gebouwd, dan is dit de release die de verbouwing urgent maakt, en de reden is techniek, niet wetgeving.

Welk model, voor een Nederlands bedrijf, deze maand

Ons standpunt is weinig verschoven ten opzichte van wat we vorige week over Fable 5.1 schreven.

  • Laat een draaiend productiesysteem staan. De winst van beide modellen komt niet terug op kort werk in één beurt, en dat is het meeste van wat een mkb-bedrijf echt draait.
  • Voor agentic werk met lange context: doe de beurtentelling voordat u een model kiest. Dezelfde twintig echte invoeren door beide, beurten tellen en de rekening ernaast. Komt Astra niet onder ongeveer de helft van de beurten uit, dan is Fable 5.1 voordeliger bij dezelfde lijstprijs.
  • Voor computergebruik, schermlezen of incidentrespons ligt Astra voor op de gepubliceerde cijfers, en de verbetering op prompt injection is degene die telt.
  • Voor analytisch werk met tools leidt Fable 5.1 nog steeds op Humanity's Last Exam met tools, en de effortknop geeft u een kostenregeling die Astra niet net zo scherp biedt.
  • Voor alles dat achteraf uitgelegd moet worden, aan een accountant, een klant of een rechter, kiest u op wat u kunt loggen, niet op wat het model scoort.

Vier dingen die deze week de moeite waard zijn

  • Doe de beurtentelling. Twintig echte invoeren, beide modellen, beurten en euro's naast elkaar. Het kost een middag en beslecht een discussie die geen benchmark kan beslechten.
  • Open uw eigen logs en vraag wat u een accountant zou overhandigen. Is het antwoord het denkspoor, dan heeft u een klus van twee weken, en die was al te laat.
  • Roteer uw sleutels en beperk elke sleutel tot één taak. Doe dat deze week, niet omdat Astra vijandig is, maar omdat dezelfde capaciteit nu aan beide kanten van het hek staat.
  • Neem één workflow die u op prompt injection had geblokkeerd en test hem opnieuw. Op 8,5 procent haalt hij misschien uw norm met een mens ervoor. Misschien ook niet. Hoe dan ook weet u het dan.

Wilt u die beurtensom op uw eigen gebruik in plaats van op een benchmark, dan is dat precies wat ons werk aan LLM-optimalisatie inhoudt. Blijkt het antwoord een agent te zijn in plaats van een modelwissel, dan zet onze pagina over AI-agents laten ontwikkelen uiteen wat dat kost en hoe lang het duurt.

Veelgestelde vragen

Wat is recurrent depth in GPT-6 Astra, in gewone taal?

In plaats van alleen te denken door leesbare tokens te schrijven, itereert Astra een blok van zijn eigen lagen over een continue interne toestand en verfijnt die voordat er iets wordt opgeschreven. Dat koopt redeneerdiepte zonder outputtokens te betalen. De keerzijde is dat een deel van de redenering niet meer als tekst bestaat, dus niet te lezen of te loggen is. OpenAI's system card noemt de teruggang in monitorbaarheid serieus.

Is GPT-6 Astra beter dan Claude Fable 5.1?

Dat hangt van de taak af. Astra leidt op FrontierMath Tier 4 v2 (97,6 tegen 87,8), computergebruik en cyberbenchmarks. Fable 5.1 leidt op Humanity's Last Exam met tools (65,0 tegen 57,2). Op Terminal-Bench 4.0 is het verschil ongeveer twee punten, en dat valt binnen de standaardfout van 3,5 tot 4,5 punten die Anthropic voor die familie publiceert. De veel geciteerde ARC-AGI-3-score van 99,9 procent komt uit een stateful adapter harness; via de gewone API scoort hetzelfde model ruwweg 17 tot 63 procent.

Astra en Fable 5.1 kosten hetzelfde. Waarom zou de rekening verschillen?

Door de cache reads. Beide kosten $ 10 per miljoen input en $ 50 per miljoen output, en beide rekenen $ 12,50 per miljoen voor een cache write. Maar Astra rekent $ 1,00 per miljoen cache-readtokens tegen $ 0,25 bij Fable 5.1. Bij een agent met 120.000 tokens gecachte context, 2.000 verse inputtokens en 1.000 outputtokens per beurt kost Astra $ 0,190 per beurt tegen $ 0,100. Astra moet dezelfde klus in ongeveer 53 procent van de beurten afmaken om quitte te spelen.

Breekt het verlies van de chain of thought onze AI-verordeningcompliance?

Vrijwel zeker niet, om twee redenen. Ten eerste verschoof de Digital Omnibus (Verordening (EU) 2026/1744) zelfstandige hoogrisicoverplichtingen uit Annex III naar 2 december 2027, dus de meeste Nederlandse mkb-bedrijven hebben dit kwartaal geen nieuwe deadline. De transparantieplicht van artikel 50 geldt wel sinds 2 augustus 2026. Ten tweede was het redeneerspoor nooit betrouwbaar bewijs: Anthropic mat dat Claude 3.7 Sonnet een gebruikte hint slechts ongeveer 25 procent van de keren noemde. Log in plaats daarvan invoer, toolcalls met argumenten, toolresultaten, uitvoer, de deterministische controle, model-ID, effortniveau en prompthash.

Wat betekent de Critical-classificatie voor cyber voor een gewoon bedrijf?

Astra is het eerste model dat OpenAI binnen zijn Preparedness Framework als Critical voor cybersecurity beoordeelt, wat betekent dat het onbekende kwetsbaarheden in geharde systemen kan vinden en misbruiken zonder stap-voor-stapbegeleiding. Volledige capaciteit is afgeschermd voor defensieve securityorganisaties via het Daybreak-programma. Voor de rest is het gevolg defensief, niet offensief: sneller patchen, credentials roteren, elke API-sleutel beperken tot één taak, en ervan uitgaan dat uw internetgerichte systemen nu worden afgetast door gereedschap dat beter code leest dan uw laatste pentest.
Onze AI-diensten AI-consultancy AI-automatisering AI-agents AI-implementatie Prijzen

Iets hiervan toepassen in uw bedrijf?

Wij maken van deze concepten werkende tools: gegrond, veilig en meetbaar. Begin met een gratis consult.

Gratis consult boeken →