Klopt je AI-systeem zes maanden later nog? Niemand weet het, tenzij iemand het heeft gemeten
Een geautomatiseerde workflow gaat live. De eerste maand houdt iedereen hem in de gaten. In de derde maand zijn de mensen die het werk vroeger deden met andere dingen bezig, is de leverancier doorgegaan naar andere klanten, en levert het systeem output die niemand controleert, omdat het niet zichtbaar kapot is. In de zesde maand is de prijslijst voor klanten veranderd, stuurt een leverancier facturen in een nieuw formaat, en zit het model dat nauwkeurig was op de cases waarop het werd gebouwd, er stilletjes naast bij een vijfde van de cases die het nu te zien krijgt. Er is niets misgegaan. Er is geen melding geweest. Het systeem draait nog, en het klopt niet meer.
Dit artikel legt voor een COO of operationeel directeur, en niet voor een engineer, uit wat een Evaluatiesuite is, waarom die het enige eerlijke antwoord is op “klopt het nog”, en waar je om moet vragen zodat dat antwoord over zes maanden bestaat. Het vertrekt vanuit de positie dat het grootste deel van een workflow helemaal geen AI hoort te zijn, en dat het deel dat het wel is, er voor altijd een getal bij nodig heeft.
Belangrijkste punten
- Een Evaluatiesuite is een golden dataset plus een maandrapport. Cases die je eigen team correct heeft afgehandeld, stap voor stap gescoord en elke maand opnieuw tegen het live systeem gedraaid.
- Vertrouwen is het verkeerde instrument. De mensen die deze systemen bouwen, wantrouwen ze meer dan ze ze vertrouwen: 46% van de developers wantrouwt actief de nauwkeurigheid van AI-tools, tegenover 33% die erop vertrouwt (Stack Overflow, 2025). Een COO die gevraagd wordt er één in productie te vertrouwen, heeft recht op een getal.
- Scoor de stappen die een model nodig hebben, niet het hele systeem. De meeste stappen zijn opzoekingen en regels. In de orderverwerking van een Europese fabrikant hadden drie van de elf stappen een model nodig (SUPALABS-projectdata, 2024–2026). Die drie krijgen de golden dataset.
- Koop het als aparte post. Een gebundelde evaluatie is het eerste wat sneuvelt wanneer de bouw uitloopt. Apart geoffreerd blijft ze overeind.
Wat “klopt nog” in operationele termen betekent
Een workflow klopt wanneer hij de output levert die de persoon die het werk vroeger deed zou hebben geleverd, op de cases die daadwerkelijk binnenkomen. Beide helften doen ertoe. “De output die die persoon zou hebben geleverd” betekent dat de norm het oordeel van je eigen team is, niet een benchmark die de leverancier heeft gekozen. “Op de cases die daadwerkelijk binnenkomen” betekent dat de norm de uitzonderingen moet omvatten, de klant die orders als foto stuurt, de factuur die verwijst naar een inkooporder die niet bestaat, want juist daar gaat een systeem als eerste afwijken.
Afwijking, of drift, heeft drie alledaagse oorzaken, en geen ervan is dramatisch. De wereld verandert: een prijslijst, het documentformaat van een leverancier, een regelgeving, de klantenmix. Het systeem verandert: een modelversie wordt door de provider bijgewerkt, een connector krijgt een patch, een regel wordt aangepast om één geval te repareren en breekt ongemerkt een ander. En de mensen veranderen: de medewerker die foute output in één oogopslag herkende, is gepromoveerd, en de nieuwe weet niet hoe fout eruitziet. Een systeem dat zes maanden aan alle drie is blootgesteld zonder te worden gemeten, is niet “waarschijnlijk in orde”. Het is ongemeten.
Wat een Evaluatiesuite is
Een Evaluatiesuite bestaat uit twee delen, en beide zijn gewoon genoeg dat een COO ze zonder engineer kan specificeren.
Het eerste deel is een golden dataset: een set echte cases uit je eigen historie, orders, facturen, claims, concepten, elk gekoppeld aan de output die je team heeft geleverd en afgetekend. Geen synthetische voorbeelden. Geen demodata van de leverancier. Jouw cases, inclusief de lastige, zo gekozen dat de set de uitzonderingen uit het Uitzonderingenregister dekt en niet alleen het ideale pad. Een paar honderd cases is voor één workflow meestal genoeg; het aantal doet er minder toe dan de vraag of de uitzonderingen vertegenwoordigd zijn in verhouding tot hoe vaak ze werkelijk voorkomen.
Het tweede deel is een slagingspercentage per stap. De workflow wordt niet als geheel gescoord, maar stap voor stap, en alleen op de stappen waarin een oordeel zit. Een opzoeking hoeft niet gescoord te worden; die is correct geïmplementeerd of niet. Een stap waarin een model de pdf van een leverancier leest en bepaalt naar welke artikelcode uit de catalogus die verwijst, wel. In de orderverwerking van een Europese fabrikant die SUPALABS stap voor stap in kaart bracht, hadden drie van de elf stappen echt een model nodig, en de andere acht waren parsing, opzoekingen, validatie en routering (SUPALABS-projectdata, 2024–2026). De golden dataset scoort die drie. De andere acht worden één keer getest, zoals alle software, en verder met rust gelaten.
Combineer die twee en draai ze elke maand tegen het live systeem, en je hebt een maandelijks nauwkeurigheidsrapport: per oordeelsstap het aandeel golden cases dat het systeem deze maand goed had, vergeleken met vorige maand en met de drempel die jij hebt vastgelegd. Dat rapport is het antwoord op “klopt het nog”. Het is één pagina. Het systeem schrijft het over zichzelf, en dat maakt het de enige testimonial die iets waard is.
Wat een maandelijks nauwkeurigheidsrapport bevat
| Regel | Wat het een COO vertelt |
| Slagingspercentage per oordeelsstap, deze maand vs vorige maand | Of een stap afwijkt, en welke |
| Slagingspercentage vs de drempel die jij hebt vastgelegd | Of de stap zijn huidige bevoegdheidsniveau houdt of een niveau terugzakt |
| Golden cases die deze maand zijn toegevoegd | Of de dataset nog overeenkomt met de cases die werkelijk binnenkomen |
| Regressiemeldingen, en wat er veranderde | Welke van de drie oorzaken van drift verantwoordelijk was |
| Kosten per run, deze maand vs vorige maand | Of een goedkoper model een stap met hetzelfde slagingspercentage kan uitvoeren |
Waarom vertrouwen het verkeerde instrument is
Het alternatief voor meten is vertrouwen, en het vertrouwen in AI-output beweegt de verkeerde kant op naarmate het gebruik toeneemt. De Stack Overflow Developer Survey van 2025 vond dat 84% van de developers AI-tools gebruikt of van plan is te gebruiken, en in dezelfde enquête dat 46% de nauwkeurigheid van die tools actief wantrouwt, tegenover 33% die erop vertrouwt. Dat zijn de mensen die deze systemen beroepsmatig bouwen en het best zien hoe ze falen. Als zij niet op vertrouwen willen draaien, hoort een operationeel directeur die verantwoordelijk is voor de output van een wachtrij met leveranciersfacturen dat ook niet te hoeven.
Daarom is de geruststelling van een leverancier bij de livegang ook geen bewijs. Een nauwkeurigheidscijfer bij de livegang is een meting op de dag dat de wereld, het systeem en de mensen nog precies waren zoals de leverancier ze achterliet. Het maandrapport is dezelfde meting nadat alle drie zijn verschoven. Het eerste vertelt je dat het systeem werkte. Het tweede vertelt je dat het werkt.
Hoe het rapport de bevoegdheid bepaalt
De Evaluatiesuite is niet alleen een monitor. Het is het mechanisme waarmee een geautomatiseerde taak het recht verdient om te handelen. Elke taak begint op het niveau Concept: het systeem bereidt het werk voor, een mens maakt het af, en de golden dataset scoort de concepten. Wordt het slagingspercentage dat jij als drempel hebt vastgelegd op echte cases gehaald, dan gaat de taak naar Goedgekeurd: het systeem bereidt de volledige actie voor en een benoemde persoon geeft akkoord. Alleen voor omkeerbare stappen, en alleen als het slagingspercentage standhoudt, gaat een taak naar Autonoom, waar het systeem handelt en het team achteraf controleert. Een regressie in het maandrapport zet de taak een niveau terug tot het slagingspercentage weer op peil is. Onomkeerbare stappen, alles wat iets indient bij een instantie, goederen verstuurt of geld overmaakt, blijven op Goedgekeurd, hoe nauwkeurig ook, want een omkeerbare fout is een kostenpost en een onomkeerbare een aansprakelijkheid.
De drempels zijn van jou. Niets schuift door omdat de leverancier dat zegt. Dat is het verschil tussen “human in the loop” als slogan en als getal, en het staat volledig uitgewerkt op de methodepagina.
Waar je om vraagt, vóór de bouw
Vier dingen, allemaal te controleren op een offerte of in een scopedocument.
- De Evaluatiesuite als aparte post. Niet gebundeld in de bouw. Een gebundelde evaluatie is het eerste wat sneuvelt wanneer de bouw uitloopt, en de bouw loopt altijd ergens uit. Apart geoffreerd overleeft ze de planning.
- Een golden dataset op basis van jouw cases, inclusief de uitzonderingen. Vraag hoe de cases worden gekozen en of het Uitzonderingenregister die selectie stuurt. Een dataset met alleen schone cases rapporteert nog een hoog slagingspercentage op de dag dat dat niet meer waar is.
- Scoring per stap, alleen op de oordeelsstappen. Vraag welke stappen worden gescoord en waarom. Het antwoord hoort een korte lijst te zijn die overeenkomt met de AI-grensmap. Een partner die voorstelt “het systeem” te scoren, heeft de stappen niet geclassificeerd.
- Het maandrapport, met een benoemde ontvanger, dat doorloopt nadat de partner vertrekt. Vraag wie het ontvangt, wat er gebeurt als een regel de drempel overschrijdt, en of de golden dataset van jou blijft als de dienst stopt. Het juiste antwoord op die laatste vraag is ja: het systeem draait in jouw accounts, de dataset is van jou, en het enige wat stopt, is het rapport.
De zesmaandentoets
Hier is het hele artikel als één vraag die je aan elke leverancier kunt stellen, of aan je eigen team over een systeem dat al live is. Zes maanden vanaf nu, op een dinsdag, levert de wachtrij met leveranciersfacturen een verkeerde match op die niemand opmerkt, omdat hij eruitziet als alle andere. Wat had je in de huidige opzet die ochtend gewaarschuwd? Is het antwoord een persoon die toevallig oplet, dan draai je op vertrouwen. Is het antwoord een regel in een maandrapport die een drempel overschreed die jij hebt vastgelegd, dan draai je op meting. Alleen het tweede overleeft de promotie van die persoon. De Evaluatiesuite is niet het dure deel van een AI-workflow. Het is het deel dat de rest de moeite waard maakt, en wat een partner verder hoort op te leveren, behandelen we in de vijf documenten om naar te vragen.
Een getal, geen geruststelling
Elke bouw van SUPALABS wordt opgeleverd met een Evaluatiesuite als aparte post op de offerte, een golden dataset op basis van jouw cases en een maandelijks nauwkeurigheidsrapport dat doorloopt nadat wij vertrekken.
Bekijk hoe een traject verloopt →Bronnen & referenties
- Stack Overflow, "2025 Developer Survey: AI", bron van het adoptiecijfer van 84% en van de cijfers over wantrouwen (46%) en vertrouwen (33%) in de nauwkeurigheid van AI-output.
- SUPALABS-projectdata, 2024–2026: drie van de elf stappen die een model nodig hadden in de orderverwerking van een Europese fabrikant. Geanonimiseerd per traject; geen enkele klant wordt genoemd. Met bronnen gepubliceerd op /en/work/.
Belangrijke statistieken (2025)
Verder lezen
Veelgestelde vragen
Innovation9 min2026-09-09

