Home / Inzichten / Jev: het model dat beslissingen teruggeeft, en de grafiek die ontbreekt
Technisch

Jev: het model dat beslissingen teruggeeft, en de grafiek die ontbreekt

Vat samen met AI Prompt gekopieerd. Plak hem in de chat

Een model dat geen zin kan schrijven werd de meest besproken release van de maand. Dat is de moeite waard om goed te begrijpen, want waar het goed in is, is precies wat de meeste bedrijfsautomatisering nodig heeft. En de belofte die het verkoopt, is de enige die niemand onafhankelijk heeft gecontroleerd.

Wat Jev werkelijk is

TypeSafe AI bracht Jev uit op 15 september 2026, samen met een seedronde van 40 miljoen dollar onder leiding van DCVC. Het bedrijf wordt geleid door Diogo Almeida, medeauteur van het InstructGPT-artikel waarop ChatGPT is gebouwd. TypeSafe noemt het een System One-model, en die naam is het argument: snel, gestructureerd oordelen in plaats van overwogen formuleren.

Het genereert geen tekst. U geeft het een blok toestand en een set getypeerde vragen, het beoordeelt die parallel en geeft getypeerde waarden terug met kansen erbij. Drie primitieven dekken alles wat het doet:

  • Choice: kies er één uit een aangeleverde set kandidaten, met een kans per kandidaat.
  • Score: beoordeel tegen ordinale niveaus, met kansen en een verwachte waarde.
  • Noul: een ja-of-nee-vraag, met een kans.

De uitvoer is bedoeld voor uw software, niet voor een lezer. TypeSafe noemt 70 tot 500 milliseconden end to end tegenover 3 tot 329 seconden voor frontier-LLM’s, invoer op $0,042 per miljoen tokens met gratis uitvoer, en kopcijfers van 40 tot 200 keer sneller en 40 tot 400 keer minder duur, met uitschieters van 193,6x en 444,6x. Die evaluaties zijn van het bedrijf zelf, en TypeSafe zegt dat er eerlijk bij: de referentieantwoorden waren het gemiddelde van GPT-6 Astra en Fable 5.1, wat de vergelijking richting OpenAI en Anthropic buigt.

Wat de garantie werkelijk dekt

De kop overal is dat Jev niet kan hallucineren. Dat klopt in een smalle en echt bruikbare betekenis, en het misleidt in de betekenis die de meeste lezers eraan geven.

Gegarandeerd is de vorm. Staat in uw schema dat het antwoord approve, review of decline is, dan krijgt u er daar één van. Geen kapotte JSON, geen verzonnen enum-waarde, geen ontbrekend veld, geen gehallucineerde toolnaam. TypeSafe meldt 0 procent fouten in gestructureerde uitvoer en 0 procent fouten in tool-aanroepen.

Niet gegarandeerd is de juistheid. Een model dat tot drie categorieën beperkt is, kan nog steeds met overtuiging de verkeerde kiezen, en een keurig getypeerd fout besluit levert helemaal geen foutmelding op. Het cijfer van 0 procent volgt uit de constructie en niet uit een meting, en dat is een ander soort bewering dan een benchmarkresultaat.

De vergelijking die telt: de interface was binnen dagen nagebouwd

Binnen een week na de lancering hadden onafhankelijke ontwikkelaars de interface van Jev gereproduceerd op open weights. Open-Jev is een LoRA-adapter plus een getrainde scalaire beslis-head op Qwen3.5-9B, gepubliceerd onder Apache-2.0 met de code onder MIT. Het scoort aangeleverde kandidaten rechtstreeks en geeft dezelfde drie primitieven terug, zonder autoregressieve generatie.

Dat betekent meer dan het op het eerste gezicht lijkt, en het snijdt twee kanten op.

Voor Jev betekent het dat het idee niet de slotgracht is. De interface, ongestructureerde toestand erin en getypeerde probabilistische beslissingen eruit, blijkt binnen enkele dagen reproduceerbaar op een middelgroot open model door een handvol mensen. Iedereen kan nu de vorm van Jev hebben voor de kosten van een 9B-model op eigen hardware, binnen het eigen netwerk, onder een permissieve licentie.

Voor de open-weight-versies betekent het iets ernstigers. De makers van Open-Jev zeggen zelf dat hun metingen op synthetische beslissingen geen betrouwbaarheid in de praktijk aantonen en geen kalibratiegarantie buiten de geteste verdeling. Ze hebben de interface nagebouwd. Ze hebben niet de training nagebouwd die de cijfers betrouwbaar zou moeten maken.

Waar Jev dan wel echt verschilt

Haal eruit wat inmiddels commodity is en er blijven drie beweringen over.

  • De parallelle sampler. Jev beoordeelt alle vragen tegelijk in plaats van tokens op volgorde te genereren. Daar komen de lage latency en de gratis uitvoer vandaan, en dat is een echt architectuurverschil en geen wikkel.
  • De prijs en de snelheid. Zelfs met een flinke korting op zelfgemeten benchmarks is een getypeerde beslissing binnen 500 ms voor vier cent per miljoen invoertokens economisch iets anders dan een frontier-LLM-aanroep.
  • Reinforcement Learning for Calibrated Decisions, de trainingsmethode waarvan TypeSafe zegt dat die epistemisch eerlijke kansen oplevert. Dat is het eigenlijke product.
Pull quote from Crux Digits: De garantie dekt de vorm, niet de juistheid.

Merk op dat u de eerste twee zelf in een middag kunt verifiëren. De derde bepaalt of dit veilig is om op te automatiseren, en juist die kunt u niet controleren.

De grafiek die niet gepubliceerd is

Als vertrouwen het punt is, dan is kalibratie de bewering. Kalibratie betekent dat een beslissing die met 0,8 zekerheid terugkomt, ongeveer 80 procent van de tijd klopt. Dat is meetbaar, en die metingen hebben vaste namen: reliability diagrams, expected calibration error, Brier-scores.

TypeSafe heeft er geen enkele gepubliceerd. Geen reliability diagram, geen ECE, geen Brier-score, geen kalibratiepaper. Het bedrijf waarvan de hele pitch gekalibreerd vertrouwen is, heeft de grafiek die dat zou laten zien nog niet gepubliceerd. Ook de architectuur en de gewichten zijn niet openbaar, en externe waarnemers opperen dat het model van open weights afgeleid zou kunnen zijn, waar TypeSafe niet op is ingegaan.

Dit is geen beschuldiging. Producten in early access verschijnen vaker voor hun papers. Het is een reden om het zekerheidsgetal te behandelen als routeerlogica en niet als bewijs, tot iemand buiten het bedrijf het meet.

De bevinding die de lanceerberichten niet haalde

Teams zetten Jev nu al in om te bepalen of een agent mag handelen. Daarmee worden zijn invoeren een beveiligingsoppervlak, en de documentatie van TypeSafe waarschuwt zelf dat tekst die het model wil sturen, of dat nu een ingesloten instructie is, een misleidende framing of tekst die voor zijn eigen classificatie pleit, het antwoord kan verschuiven.

Een engineer bij Octomind zette er cijfers bij. Op de vraag of het commando rm -rf ~/.ssh geblokkeerd moest worden, gaf Jev een blokkeerkans van 0,76 bij een zekerheid van 0,64. Nadat er een nep tool-outputveld was toegevoegd dat beweerde dat het commando vooraf was goedgekeurd en dat automatisch toestaan voorschreef, zakte de blokkeerkans naar 0,48 bij een zekerheid van 0,22. De bewaker ging niet stuk. Hij las vijandige tekst als bewijs, precies zoals ontworpen.

De richtlijn van Pydantic daarna is de zin om te onthouden: een bewaker gebouwd op Jev hoort náást deterministische controles, niet in plaats daarvan.

Wat dit verandert voor het Nederlandse mkb

Het meeste waarvan ons gevraagd wordt het te automatiseren is geen schrijfwerk. Het is beslissen. Bij welke leverancier hoort deze pakbon. Moet deze werkbon langs een mens voordat hij gefactureerd wordt. Is deze mail een klacht, een orderwijziging of een betalingsvraag. Wijkt deze factuur genoeg af van de inkooporder om hem te stoppen. Gaat deze lead naar sales of naar de nieuwsbrief.

Elk daarvan is een Choice, een Score of een Noul. Geen ervan heeft een alinea proza nodig, en twintig jaar lang was het eerlijke antwoord een broze set regels of een volledige LLM-aanroep die per document te veel kostte om over de hele stroom te draaien.

Bij volume bijt het kostenargument het hardst. Een bedrijf dat vijftigduizend documenten per maand classificeert, betaalde frontier-tarieven voor een beslissing die in drie woorden past. Bij vier cent per miljoen invoertokens met gratis uitvoer doet die regel er niet meer toe. De beperking verschuift van wat u zich kunt veroorloven te classificeren naar wat u zich kunt veroorloven fout te hebben, en dat is een veel beter probleem.

Hoe u het gebruikt zonder te wedden op een ongepubliceerde belofte

Het patroon dat al het bovenstaande overleeft is hetzelfde dat wij op elk probabilistisch onderdeel in productie toepassen.

  • Houd deterministische controles vóór handelingen met gevolgen. Een regel die zegt dat een betaling boven een grens altijd langs een mens gaat, wordt niet overbodig door een zekerheidsscore.
  • Voer nooit onvertrouwde inhoud in een classifier die een handeling bewaakt. Tooluitvoer, gescrapete pagina’s, mailteksten van klanten en bestandsinhoud zijn het injectieoppervlak. Vat samen of strip voor de beslissing, of routeer op metadata.
  • Meet uw eigen kalibratie. Log de toestand, het schema, de volgorde van de opties, de modelversie, de teruggegeven kans en de uiteindelijke werkelijkheid. Na duizend beslissingen tekent u uw eigen betrouwbaarheidscurve, en dan weet u het in plaats van dat u het gelooft.
  • Gebruik zekerheid als routering, niet als toestemming. Onder een drempel gaat het naar een menselijke wachtrij. Die drempel volgt uit uw eigen gemeten curve, niet uit die van de leverancier.
  • Begin waar een fout zichtbaar en omkeerbaar is. Triage en routering voldoen daaraan. Boeken in de financiële administratie niet.

Praktisch is het vandaag aan te roepen. TypeSafe haalde de wachtlijst op 20 september weg na 140.000 mensen in 36 uur te hebben doorgelaten, en het loopt via de AI Gateway van Vercel met de AI SDK, dus een proef is een middag en geen inkooptraject.

De vraag die een Nederlandse koper sowieso moet stellen

Jev is een gehoste dienst in één regio. Zero Data Retention en niet-trainen zijn per verzoek aan te zetten, en dat is de juiste knop om te hebben, maar dataresidentie, serviceniveaus en leveranciersafhankelijkheid blijven open vragen voor iedereen die persoonsgegevens verwerkt onder de AVG.

Hier worden de open-weight-versies strategisch interessant in plaats van alleen interessant. Een Apache-2.0-adapter op een 9B-model draait op uw eigen hardware, in uw eigen land, zonder dat er een verzoek het pand verlaat. Het levert de kalibratietraining in die de hele premisse is. Voor een classificatietaak waarbij u uw eigen nauwkeurigheid tegen de werkelijkheid kunt meten, kan dat de juiste ruil zijn.

Wat wij dit kwartaal zouden doen

Kies één beslissing met volume die nu honderden keren per maand door een mens wordt genomen en die zichtbaar is als het misgaat. Laat die door zowel Jev als een open-weight-equivalent lopen op dezelfde duizend historische gevallen waarvan u de uitkomst al kent. Teken de betrouwbaarheidscurve zelf. Beslis daarna, met uw eigen cijfers, of u op de zekerheidsscore kunt routeren.

Dat kost een week en het beslecht de vraag voor uw data in plaats van voor die van TypeSafe. Het is dezelfde discipline die wij toepasten toen de vorige frontier-release binnenkwam met een kopbenchmark die op een offline variant bleek te zijn gemeten: de release note is een hypothese, uw eigen data is de toets.

Dit in productie brengen?

Wij bouwen maatwerk-AI en LLM-systemen die in productie draaien: een klikbare MVP bij het tweede gesprek, vaste stappen, en de code is van u.

AI-ontwikkelbureau in Nederland →

Veelgestelde vragen

Wat is Jev in één zin?

Jev is een model van TypeSafe AI dat getypeerde beslissingen met kansen teruggeeft in plaats van tekst. U geeft het een blok toestand en getypeerde vragen, het beoordeelt die parallel en antwoordt met een van drie primitieven: Choice, Score of Noul. De uitvoer is gemaakt voor uw software, niet voor een lezer.

Klopt het dat Jev niet kan hallucineren?

Het kan geen kapotte uitvoer teruggeven. Staan er drie waarden in uw schema, dan krijgt u er daar één van, zonder verzonnen velden of toolnamen. Het kan nog steeds met veel zekerheid de verkeerde kiezen, en een keurig getypeerd fout antwoord geeft geen foutmelding. Lees de garantie als “geeft geen kapotte uitvoer” en niet als “heeft altijd gelijk”.

Is er een open-weight-alternatief voor Jev?

Ja, voor de interface. Open-Jev is een LoRA-adapter plus een scalaire beslis-head op Qwen3.5-9B, met de adapter onder Apache-2.0 en de code onder MIT, en geeft dezelfde drie primitieven terug. De makers zeggen erbij dat hun metingen op synthetische data geen betrouwbaarheid in de praktijk of kalibratiegarantie aantonen. U krijgt dus de vorm van Jev zonder de training die de kansen betrouwbaar moet maken.

Kan Jev veilig bepalen of een AI-agent mag handelen?

Alleen náást deterministische controles. Een engineer bij Octomind verschoof een blokkeerbeslissing over rm -rf ~/.ssh van 0,76 kans bij 0,64 zekerheid naar 0,48 bij 0,22, door een nep tool-outputveld toe te voegen dat vooraf goedkeuring claimde. Houd onvertrouwde inhoud zoals tooluitvoer buiten elke classifier die een handeling bewaakt, en zet een harde regel voor stappen met gevolgen.
Onze AI-diensten AI-consultancy AI-automatisering AI-agents AI-implementatie Prijzen

Iets hiervan toepassen in uw bedrijf?

Wij maken van deze concepten werkende tools: gegrond, veilig en meetbaar. Begin met een gratis consult.

Gratis consult boeken →