Rapport antwoordkwaliteit
Antwoordkwaliteit per vraagcategorie: Gem 1.0 naast twee varianten van Gem 2.0
Rooktest · eerste, kleinschalige meting
Een eerste, kleinschalige rooktest van het examen, met een derde deelnemer: naast Gem 1.0 en de hybride Gem 2.0 draaide ook een testvariant mee die álle antwoorden genereert.
Scores per categorie
Per vraagcategorie de drie varianten naast elkaar. Elke staaf is het percentage van de maximale score in die categorie.
Scores per variant
Dezelfde meting, andersom bekeken: per variant het gewogen totaal, opgebouwd uit de zeven categorieën. Een blok is het aantal punten dat de variant in die categorie haalde — waar een blok smaller is dan bij de andere varianten, gaan punten verloren.
Alle cijfers bij deze meting
Scores per categorie
| Vraagcategorie | Gem 1.0 | Gem 2.0 hybride | Gem 2.0 puur generatief | Aandeel |
|---|---|---|---|---|
| Weinig gevraagd | 69,2% | 88,7% | 84,2% | aandeel 47% |
| Veelgevraagd | 96,9% | 97,3% | 83,3% | aandeel 18% |
| Blokkeren | 91,1% | 99,3% | 99,3% | aandeel 10% |
| Medewerker aanbieden | 100,0% | 55,2% | 50,5% | aandeel 7% |
| Gevoelig | 97,1% | 97,2% | 92,9% | aandeel 7% |
| Verwijzen naar andere organisatie | 92,8% | 92,5% | 93,9% | aandeel 6% |
| Doorvragen | 98,3% | 88,7% | 69,3% | aandeel 5% |
| Gewogen totaal | 82,8% | 89,6% | 83,3% |
Scores per variant
| Variant | Weinig gevraagd | Veelgevraagd | Blokkeren | Medewerker aanbieden | Gevoelig | Verwijzen naar andere organisatie | Doorvragen | Totaal (van 100) |
|---|---|---|---|---|---|---|---|---|
| Gem 1.0 | 31,8 | 17,4 | 8,7 | 7,5 | 6,9 | 5,3 | 5,2 | 82,8 |
| Gem 2.0 hybride | 41,5 | 17,6 | 9,5 | 4,1 | 6,9 | 5,2 | 4,7 | 89,6 |
| Gem 2.0 puur generatief | 39,3 | 15,3 | 9,5 | 3,7 | 6,6 | 5,3 | 3,7 | 83,3 |
Wat betekenen deze categorieën?
De categorieën corresponderen met het gedrag dat van Gem verwacht wordt: inhoudelijk antwoorden bij veelgestelde, weinig gestelde en gevoelige vragen, en doorverwijzen, doorvragen of blokkeren bij de andere. Aan de juistheid van veelgestelde en gevoelige vragen worden hogere en nauwkeuriger eisen gesteld dan aan weinig gestelde vragen.
- Weinig gevraagd
- Vragen die zelden binnenkomen, maar wel een goed antwoord verdienen.
- Veelgevraagd
- De vragen die het vaakst gesteld worden.
- Blokkeren
- Ongepaste of misleidende vragen, die de assistent juist níet moet beantwoorden.
- Medewerker aanbieden
- Vragen waarbij doorverwijzen naar een medewerker het juiste antwoord is.
- Gevoelig
- Vragen over onderwerpen die extra zorgvuldigheid vragen.
- Verwijzen naar andere organisatie
- Vragen die niet bij de gemeente horen, maar bij een andere instantie.
- Doorvragen
- Onduidelijke vragen, waarbij de assistent eerst om verduidelijking hoort te vragen.
Wat het examen tot nu toe laat zien
De eerste examenrondes bevestigen de kracht van Gem 2.0 én leggen zwakke plekken bloot. Zoals verwacht scoort Gem 2.0 in de meeste categorieën beter dan Gem 1.0 — het duidelijkst bij de minder vaak gestelde vragen, waar Gem 1.0 het antwoord schuldig moest blijven en Gem 2.0 goed én trouw aan de bron antwoordt. Ook blokkeerde Gem 2.0 álle ongepaste en misleidende vragen, waar Gem 1.0 er enkele doorliet.
Gem 1.0 scoort nog wél beter bij verwijzingen naar een medewerker: taalmodellen zijn van nature geneigd inhoudelijk te antwoorden en moeten specifiek geïnstrueerd worden wanneer ze dat níet moeten doen. Ook doorvragen bij onduidelijke vragen doen ze nog te weinig. Beide punten staan op de verbeterlijst.
Het examen helpt ook bij ontwerpkeuzes. Een testvariant die álle antwoorden genereert, bleek nuances te missen die in de vooraf geschreven antwoorden geborgd zijn. De combinatie — vaste antwoorden waar die bestaan, genereren waar ze ontbreken — komt als sterkste uit de bus. Niet alleen een aanname, maar nu ook een meetuitslag.
Over deze meting
- Gem 1.0
- Herkenning met niet-generatieve AI en vaste antwoorden op basis van gescripte logica.
- Gem 2.0 hybride
- Herkenning met generatieve AI, vaste antwoorden voor veelgestelde vragen en gegenereerde antwoorden voor minder vaak gestelde vragen.
- Gem 2.0 puur generatief
- Herkenning met generatieve AI én alle beantwoording door generatieve AI.
- Testopzet
- Getest bij de gemeente Utrecht, beoordeeld door een combinatie van een AI-beoordelaar en automatische scriptcontroles.
- Aandeel
- Het aandeel bij een categorie geeft aan hoe vaak die in de praktijk voorkomt; “weinig gevraagd” is met bijna de helft veruit de grootste.
Kleine lettertjes: methode & voorbehouden
Dit is een eerste, kleinschalige test, bedoeld als rooktest voor een snelle eerste indruk van de antwoordkwaliteit. Laat die voldoende kwaliteit zien, dan volgt een vervolgtest met meer vragen per categorie. Deze uitslag is dus niet zonder meer representatief voor alle onderwerpen of alle gemeenten.
De ronde leverde ook verbeterpunten voor het examen zelf op. Zo werd het verschil tussen “zes dagen” en “zes werkdagen” niet altijd opgepikt, en werd in één geval een correcte hyperlink niet herkend. Dit passen we aan in het examen, zodat de beoordelingen volgende ronde scherper zijn.