← Terug naar Kwaliteit

Rapport antwoordkwaliteit

Antwoordkwaliteit per vraagcategorie: Gem 1.0 naast twee varianten van Gem 2.0

Rooktest · eerste, kleinschalige meting

Een eerste, kleinschalige rooktest van het examen, met een derde deelnemer: naast Gem 1.0 en de hybride Gem 2.0 draaide ook een testvariant mee die álle antwoorden genereert.

Scores per categorie

Per vraagcategorie de drie varianten naast elkaar. Elke staaf is het percentage van de maximale score in die categorie.

Scores per variant

Dezelfde meting, andersom bekeken: per variant het gewogen totaal, opgebouwd uit de zeven categorieën. Een blok is het aantal punten dat de variant in die categorie haalde — waar een blok smaller is dan bij de andere varianten, gaan punten verloren.

Alle cijfers bij deze meting

Scores per categorie

Het aandeel is het deel van de 100 punten dat deze categorie kan opleveren.
Vraagcategorie Gem 1.0 Gem 2.0 hybride Gem 2.0 puur generatief Aandeel
Weinig gevraagd 69,2% 88,7% 84,2% aandeel 47%
Veelgevraagd 96,9% 97,3% 83,3% aandeel 18%
Blokkeren 91,1% 99,3% 99,3% aandeel 10%
Medewerker aanbieden 100,0% 55,2% 50,5% aandeel 7%
Gevoelig 97,1% 97,2% 92,9% aandeel 7%
Verwijzen naar andere organisatie 92,8% 92,5% 93,9% aandeel 6%
Doorvragen 98,3% 88,7% 69,3% aandeel 5%
Gewogen totaal 82,8% 89,6% 83,3%

Scores per variant

Variant Weinig gevraagd Veelgevraagd Blokkeren Medewerker aanbieden Gevoelig Verwijzen naar andere organisatie Doorvragen Totaal (van 100)
Gem 1.0 31,8 17,4 8,7 7,5 6,9 5,3 5,2 82,8
Gem 2.0 hybride 41,5 17,6 9,5 4,1 6,9 5,2 4,7 89,6
Gem 2.0 puur generatief 39,3 15,3 9,5 3,7 6,6 5,3 3,7 83,3
Wat betekenen deze categorieën?

De categorieën corresponderen met het gedrag dat van Gem verwacht wordt: inhoudelijk antwoorden bij veelgestelde, weinig gestelde en gevoelige vragen, en doorverwijzen, doorvragen of blokkeren bij de andere. Aan de juistheid van veelgestelde en gevoelige vragen worden hogere en nauwkeuriger eisen gesteld dan aan weinig gestelde vragen.

Weinig gevraagd
Vragen die zelden binnenkomen, maar wel een goed antwoord verdienen.
Veelgevraagd
De vragen die het vaakst gesteld worden.
Blokkeren
Ongepaste of misleidende vragen, die de assistent juist níet moet beantwoorden.
Medewerker aanbieden
Vragen waarbij doorverwijzen naar een medewerker het juiste antwoord is.
Gevoelig
Vragen over onderwerpen die extra zorgvuldigheid vragen.
Verwijzen naar andere organisatie
Vragen die niet bij de gemeente horen, maar bij een andere instantie.
Doorvragen
Onduidelijke vragen, waarbij de assistent eerst om verduidelijking hoort te vragen.

Wat het examen tot nu toe laat zien

De eerste examenrondes bevestigen de kracht van Gem 2.0 én leggen zwakke plekken bloot. Zoals verwacht scoort Gem 2.0 in de meeste categorieën beter dan Gem 1.0 — het duidelijkst bij de minder vaak gestelde vragen, waar Gem 1.0 het antwoord schuldig moest blijven en Gem 2.0 goed én trouw aan de bron antwoordt. Ook blokkeerde Gem 2.0 álle ongepaste en misleidende vragen, waar Gem 1.0 er enkele doorliet.

Gem 1.0 scoort nog wél beter bij verwijzingen naar een medewerker: taalmodellen zijn van nature geneigd inhoudelijk te antwoorden en moeten specifiek geïnstrueerd worden wanneer ze dat níet moeten doen. Ook doorvragen bij onduidelijke vragen doen ze nog te weinig. Beide punten staan op de verbeterlijst.

Het examen helpt ook bij ontwerpkeuzes. Een testvariant die álle antwoorden genereert, bleek nuances te missen die in de vooraf geschreven antwoorden geborgd zijn. De combinatie — vaste antwoorden waar die bestaan, genereren waar ze ontbreken — komt als sterkste uit de bus. Niet alleen een aanname, maar nu ook een meetuitslag.

Over deze meting

Gem 1.0
Herkenning met niet-generatieve AI en vaste antwoorden op basis van gescripte logica.
Gem 2.0 hybride
Herkenning met generatieve AI, vaste antwoorden voor veelgestelde vragen en gegenereerde antwoorden voor minder vaak gestelde vragen.
Gem 2.0 puur generatief
Herkenning met generatieve AI én alle beantwoording door generatieve AI.
Testopzet
Getest bij de gemeente Utrecht, beoordeeld door een combinatie van een AI-beoordelaar en automatische scriptcontroles.
Aandeel
Het aandeel bij een categorie geeft aan hoe vaak die in de praktijk voorkomt; “weinig gevraagd” is met bijna de helft veruit de grootste.

Kleine lettertjes: methode & voorbehouden

Dit is een eerste, kleinschalige test, bedoeld als rooktest voor een snelle eerste indruk van de antwoordkwaliteit. Laat die voldoende kwaliteit zien, dan volgt een vervolgtest met meer vragen per categorie. Deze uitslag is dus niet zonder meer representatief voor alle onderwerpen of alle gemeenten.

De ronde leverde ook verbeterpunten voor het examen zelf op. Zo werd het verschil tussen “zes dagen” en “zes werkdagen” niet altijd opgepikt, en werd in één geval een correcte hyperlink niet herkend. Dit passen we aan in het examen, zodat de beoordelingen volgende ronde scherper zijn.

Alle metingen

Elke meting staat op zijn eigen pagina en blijft daar staan. Vergelijk alleen metingen die dezelfde systemen naast elkaar leggen.