Metingen vergeleken: mens versus machine
Rooktest met menselijke beoordeling — meting van 26 augustus 2026.
Vervolg op de rapportage van 12 augustus 2026. Wat verandert beoordeling door een inhoudsdeskundige aan de conclusies en de verbeterpunten voor het meetsysteem en voor Gem?
In het kort
- De automatische beoordeling is soms te streng. De automatische beoordeling gaf scores rond de 67, de inhoudsdeskundige rond de 87. Oorzaak: de automatische beoordeling herkende hyperlinks niet en gaf onterecht strafpunten. Ook scoorde de automatische beoordeling te streng op toon en taal.
- Alle drie de versies doen het hier goed. Ongeveer 9 van de 10 antwoorden zijn goed genoeg. Gem 1.0 scoort deze ronde iets hoger dan Gem 2.0, vooral door de precisie bij veelgestelde vragen; de twee Gem 2.0-versies zijn aan elkaar gewaagd.
- Verbeterpunten: het ophalen van de juiste informatie uit de database gaat bij sommige vragen minder goed, waardoor het juiste antwoord niet gegeven kan worden. Daarnaast gokt de assistent soms in plaats van doorvragen, of weigert de assistent soms in plaats van doorverwijzen.
De scores
Score van 0 tot 100 volgens de menselijke beoordelaar. De drie versies:
- Gem 1.0 is de huidige versie, met vaste antwoorden.
- Gem 2.0 Hybride gebruikt vaste antwoorden als die er zijn en schrijft anders zelf een antwoord.
- Gem 2.0 Puur Generatief schrijft elk antwoord zelf.
De onzekerheidsmarges zijn enkele procentpunten groot.
In de examens vragen we zowel naar de bekende weg (veelgestelde vragen, waar Gem veel kennis over heeft), als naar de onbekende weg (weinig gestelde vragen, waar generatieve AI beter op kan antwoorden). Door een probleem met het ophalen van informatie uit de kennisbank werkte het genereren van antwoorden bij sommige onbekende vragen niet goed. Daardoor komt Gem 1.0 in deze ronde beter uit de test.
Beter of slechter dan de vorige test?
- Verbeteringen sinds vorige testronde: Gem 2.0 weigert veel minder vaak een gewone vraag te beantwoorden en stelt nu vaker een tussenvraag waar dat nodig is.
- Regressie sinds vorige testronde: het ophalen van de juiste informatie uit de database ging bij sommige vragen minder goed, waardoor het juiste antwoord niet gegeven kon worden.
- Per saldo: het effect van de aanpassingen in Gem is zichtbaar en de menselijke beoordeling maakt duidelijk waar de verbeterpunten zijn; voor het testsysteem én voor Gem.
Belangrijkste verbeterpunten
Voor het meetsysteem
Zorg dat de automatische beoordeling hyperlinks herkent. De links in de antwoorden staan in een opmaak die de beoordeling nu niet als link ziet.
Voor Gem
Beter ophalen van informatie. Het ophalen van informatie uit de database gaat in sommige gevallen minder goed dan in de vorige ronde, waardoor het juiste antwoord niet geformuleerd kan worden.
Voorbeeld — de vraag was alleen: "Wat moet ik meenemen?"
Je weet dan nog niet waarvoor: een paspoort, een rijbewijs, een afspraak bij de balie? Het beste antwoord is dus een tegenvraag.
Gem 1.0 vraagt door: "Je hebt een vraag over wat je moet meenemen. Voor welk onderwerp wil je dat weten?" — de menselijke beoordeling gaf hier bijna alle punten.
Gem 2.0 Puur Generatief gokt dat het om een paspoort gaat: "Dit neem je mee naar de afspraak voor het aanvragen van een paspoort: Een kleurenpasfoto, niet ouder dan 6 maanden, die voldoet aan de eisen. …" — de menselijke beoordeling gaf minder dan de helft van de punten.
Hoe is dit gemeten?
Elke versie kreeg dezelfde 51 vragen, van makkelijk ("hoe vraag ik een paspoort aan") tot lastig (vragen die de assistent moet weigeren of doorverwijzen). Elk antwoord is beoordeeld op zeven onderdelen: klopt het, helpt het je verder, staat er een link, is het veilig, is het makkelijk te lezen, is de spelling goed en is de toon goed. De score is het gemiddelde van die zeven onderdelen. Bij de score per antwoord telt "klopt het" vier keer zo zwaar; een antwoord is goed genoeg vanaf 0,55 van de punten.
Wat we per criterium precies bedoelen en hoe we het meten, staat op De criteria en hoe we ze meten. Alle metingen op een rij staan op Kwaliteit in cijfers.
Wil je hier dieper op ingaan voor jouw gemeente? Vraag een gesprek aan.