Menselijke controle is waarschijnlijk de meest voorkomende beheersmaatregel in AI ontwerpen van de afgelopen twee jaar. HITL: Human In The Loop. In vrijwel elk kader staat dat er iemand meekijkt voordat er iets de deur uit gaat. Wat die persoon vervolgens verandert was eigenlijk zelden gemeten. Tot voor kort.
Eduardo Davalos en Yike Zhang publiceerden op 15 september 2026 een preprint waarin ze het wel proberen. Ze schreven het voor het onderwijs, maar de vraag is breder. Ze keken niet naar het eindproduct, nee, maar naar toetsaanslag data uit drie publieke corpora. Namelijk: 1) een co-writing-corpus, 2) programmeertelemetrie en 3) een basislijn van voor de taalmodellen. Hun vraag was of AI hulp een tijdssignatuur achterlaat. En ja, dat doet het. Wat een model inbrengt komt in bursts van volumes in context die zeer duidelijk buiten de eigen basislijn van de auteur vallen, in schrijven en in programmeren allebei.
Twee getallen uit dat werk zijn blijven hangen. In schrijftaken, in dit onderzoek verhalen en betogen, haalt 93 procent van de door AI ingevoegde tekens het einddocument. Dus amper aanpassingen door de mens. In programmeertaken haalt 14 procent van de geaccepteerde suggesties ongewijzigd het einddocument. Die twee tellen niet hetzelfde. Het zijn eigenlijk tekens tegenover aangenomen suggesties. En dat is geen eerlijke vergelijking. Tekens tegenover aangenomen suggesties is geen eerlijke vergelijking, en een suggestie die niet compileert verdwijnt namelijk vanzelf. Maar het gat is wel groot genoeg om de volgende vraag te stellen, namelijk: "waar komt dit vandaan?".
Het verschil zit in wat terugpraat
De makkelijke verklaring is eigenlijk dat programmeurs kritischer zijn dan schrijvers. Dat is wellicht te makkelijk en dat realiseer ik me. Maar wat programmeurs hebben is een systeem dat binnen een minuut terugpraat; feedback geeft.
De compiler weigert, een test valt om, of een collega doet een review en schiet gaten in je door AI gegenereerde pull request. Elk van die signalen dwingt tot een beslissing over de aangeleverde tekst en pas zo'n beslissing maakt van meelezen echt beoordelen. Je komt er niet omheen. Zeker niet als het proces goed is ingericht. Twee ogenprincipes in GitHub.
Bij een beleidsstuk, een klantbrief of een besluitnota bestaat dat tegenspel vaak niet. Daar is de enige controle iemand die leest wat er al staat, en die dat doet in de stille aanname dat het waarschijnlijk wel klopt. Want feedback geven: dat is natuurlijk spannend.
Lisanne Bainbridge beschreef dat mechanisme in 1983 in "Ironies of Automation": dat naarmate je meer automatiseert, worden de momenten waarop de mens moet ingrijpen zeldzamer. Dit terwijl zijn verantwoordelijkheid voor precies die momenten juist zou moeten toenemen. Hij oefent minder en moet meer. Mijn vertaling: we worden lui.
De rol van de mens als restpost
Er is een tweede lezing, en die komt eigenlijk van mijzelf uit mijn eigen notitie en keynotes. Bepaalde processtappen zijn er voor de mens en niet voor de machine. Overdrachtsmomenten, statusoverleg, dubbele controles, het vier-ogen-principe, grote incidenten. Ze staan in een proces omdat er mensen in zaten. Wie zo'n proces een op een digitaliseert, sleept die stappen mee en houdt de kosten die ze veroorzaken. Moeten deze stappen wel? Wat automatiseren we nu echt?
De mens in de lus is diezelfde stap maar dan in een omgekeerde richting. Hij is aan een machineproces toegevoegd. En eigenlijk in vrijwel elk kader ook nog eens zonder dat iemand daarna heeft vastgesteld wat deze nou echt daadwerkelijk oplevert. Raja Parasuraman en Victor Riley beschreven dit patroon al in 1997 voor klassieke automatisering; proces automatisering. Ontwerpers bepalen eerst wat de machine doet, en wat overblijft wordt de rol van de operator. Die rol is dus geen ontwerpkeuze maar een restpost.
"Ik verlies toch mijn baan niet? Nee hoor Henk, we hebben nog wat restjes. Ah! Gelukkig maar".
En dat is nu een van de manieren waarop automatisering volgens Raja en Victor misgaat.
In augustus 2026 verscheen in JAMA een opiniestuk dat die restpost duurder maakt dan een vinkje. De auteurs stellen dat autonome AI bij medisch redeneren binnenkort beter presteert dan welk team van arts en model ook. Dat toezichthouders om deze reden geen mens in de lus zouden moeten voorschrijven. Wel geven ze zelf toe dat vrijwel al het bewijs uit simulaties komt, niet uit echte patiëntenzorg. De richting is duidelijk genoeg om eigenlijk ongemakkelijk te zijn.
Wanneer de mens er wel hoort
Fares Fourati, Hinrich Schütze, Eyke Hüllermeier en Iryna Gurevych leverden in juli 2026 een theoretisch kader met drie redenen waarom menselijke participatie blijft bestaan, ook bij zeer ZEER capabele AI.
- Technisch, wanneer mensen iets inbrengen dat het model mist.
- Normatief, wanneer deelname op zichzelf waardevol is voor groei en zelfbeschikking.
- En wat zij target emergence noemen. Namelijk, bij sommige activiteiten ligt het doel niet vooraf vast, maar ontstaat het door de interactie zelf. Daar is menselijke deelname niet een middel tot de uitkomst, maar constitutief voor die uitkomst. Dus het doel is vooraf niet gesteld, maar wordt gaande weg ontdekt. "Dokter ik voel mij niet lekker" Hmm..
Dat geeft dus een scherper criterium dan een simpel risicoklasse. Ligt het doel vast en is de uitkomst objectief te scoren? Dan is een verplichte mens in de lus vooral een overgenomen processtap.
Ontstaat het doel pas in het doen, een gesprek met een patiënt over wat hij nog wil, een productrichting die je al pratend en discussiërend vindt, dan is diezelfde mens niet weg te automatiseren. Hoe goed het model ook wordt.
En dan wordt het meetbaar
Het derde deel van het paper van Davalos en Zhang is het deel met de langste staart. Modellen die alleen naar tijdspatronen kijken, herkennen volledig uitbesteed werk eigenlijk bijna perfect. Met een F1-score van 0,997 of hogr! zien ze het verschil tussen gesimuleerde volledige uitbesteding en echt, menselijk werk. Gewone samenwerking blijft in dezelfde data moeilijk te onderscheiden van onbegeleid werk.
Dat is dus een pure asymmetrie met gevolgen. Wat meetbaar wordt is de afwezigheid van werk en dus niet de kwaliteit ervan. Trek je het door naar organisaties, dan kan een auditor straks vaststellen dat er feitelijk niemand aan tafel zat, namelijk een audittrail op tijdspatronen. Hij kan alleen niet vaststellen of wie er wel zat het goed deed.
Charles Goodhart beschreef in 1975, voor het Britse monetair beleid, wat er dan gebeurt. In de bekende formulering van Marilyn Strathern: zodra een maatstaf een doel wordt verliest hij zijn waarde als maatstaf.
Een organisatie die wordt afgerekend op hoeveel haar mensen aanpassen aan modeloutput krijgt gewoon mensen die dingen aanpassen. Het ritme klopt, het dossier klopt maar er is helaas niemand beter gaan nadenken.
De conclusie is niet dat meten zinloos is; dat is het zeer zeker niet. De conclusie is dat deze meting precies een ding kan. Namelijk vaststellen of er uberhaupt iemand heeft gewerkt en dat ze ongeschikt is als rapportcijfer voor de kwaliteit van dat werk.
Wie haar toch zo gebruikt, bouwt over een paar jaar een dashboard dat het verkeerde gedrag beloont. Doe maar niet.
Bronnen
- Eduardo Davalos en Yike Zhang, "Does AI Assistance Leave a Temporal Fingerprint? Detecting Overreliance in AI-Assisted Writing and Programming", arXiv:2609.17883, 15 september 2026. Preprint, niet peer-reviewed. https://arxiv.org/abs/2609.17883v1
- Fares Fourati, Hinrich Schütze, Eyke Hüllermeier en Iryna Gurevych, "The Boundaries of Automation: A Theory of Persistent Human Participation", arXiv:2607.21547, 24 juli 2026. https://arxiv.org/abs/2607.21547
- "As AI beats doctors, regulators shouldn't force a human into the loop, JAMA piece says", The Decoder, 18 augustus 2026 (over een opiniestuk in JAMA). https://the-decoder.com/as-ai-beats-doctors-regulators-shouldnt-force-a-human-into-the-loop-jama-piece-says
- Lisanne Bainbridge, "Ironies of Automation", Automatica 19(6), 1983.
- Raja Parasuraman en Victor Riley, "Humans and Automation: Use, Misuse, Disuse, Abuse", Human Factors 39(2), 1997.
- Charles Goodhart, 1975, over het Britse monetair beleid.
- Marilyn Strathern, "'Improving ratings': audit in the British University system", European Review 5(3), 1997.
- Simon Janssen, eigen notitie 17 september 2026.
Terug naar blog