← Terug naar Kwaliteit

Rapport antwoordkwaliteit

Antwoordkwaliteit per criterium: Gem 1.0 naast twee varianten van Gem 2.0

Rooktest · onvolledig uitgevoerd

Hoe scoren de drie varianten op de vijf algemene kwaliteitscriteria die voor elk antwoord gelden, ongeacht welke vraag er gesteld is? Dezelfde vragen gingen langs Gem 1.0 en langs twee varianten van Gem 2.0.

Scores in procenten · kleur = scoreband · het totaal is het gemiddelde van de vijf criteria, elk even zwaar meegeteld.
Criterium Gem 1.0 Gem 2.0 hybride Gem 2.0 puur generatief
Juistheid 93,3% 94,3% 93,1%
Behulpzaamheid 62,4% 53,5% 77,8%
Eenvoud 65,7% 71,6% 67,8%
Spelling & grammatica 85,1% 90,9% 94,3%
Toon 54,9% 56,1% 69,8%
Gewogen totaal 72,3% 73,3% 80,6%

Scorebanden

  • 90–100%
  • 80–89%
  • 70–79%
  • 60–69%
  • < 60%
Wat betekenen deze criteria?

Vijf criteria die voor elk antwoord gelden, los van de inhoud van de vraag.

Juistheid
Doet het antwoord geen onterechte aannames over de situatie van de vragensteller.
Behulpzaamheid
Biedt het antwoord een concrete volgende stap of een manier om meer te weten te komen.
Eenvoud
Gewone woorden, korte zinnen, actieve vorm, logische opbouw. Bestaat uit vier deelmetingen.
Spelling & grammatica
Taalkundig foutloos.
Toon
Professioneel-vriendelijk, jij-vorm, empathie waar nodig.

Wat betekent dit?

Op alle drie de varianten is Juistheid het sterkste punt (93–94%) en Toon het zwakste (55–70%): de antwoorden gebruiken niet consistent de gewenste jij-vorm en missen wat empathie. Behulpzaamheid verschilt het duidelijkst tussen de varianten. Gem 2.0 puur generatief scoort daar 78%, ruim boven Gem 1.0 (62%) en Gem 2.0 hybride (54%, al is dat cijfer op een kleinere steekproef gebaseerd).

Gem 2.0 puur generatief heeft over de volledige set de hoogste gewogen totaalscore (80,6 van de 100). Gem 2.0 hybride staat er op de 23 wél gescoorde vragen beter voor dan Gem 1.0, maar dat is nog geen uitspraak over de volledige set van 51.

Over deze meting

Testset
51 vragen uit 9 examens. Elke score is het gemiddelde over die vragen.
Testopzet
Getest bij de gemeente Utrecht, beoordeeld door een AI-beoordelaar.
Gem 1.0
Herkenning met niet-generatieve AI en vaste antwoorden op basis van gescripte logica.
Gem 2.0 hybride
Herkenning met generatieve AI, vaste antwoorden voor veelgestelde vragen en gegenereerde antwoorden voor minder vaak gestelde vragen.
Gem 2.0 puur generatief
Herkenning met generatieve AI én alle beantwoording door generatieve AI.

Kleine lettertjes: methode & voorbehouden

Deze opstarttest is onvolledig uitgevoerd vanwege beperkingen in het evaluatiesysteem. De cijfers zijn daarmee onder voorbehoud.

Gem 2.0 hybride is op 23 van de 51 vragen gescoord. De overige 28 vragen (meerinfo, sensitive, simple, tussenvragen, verwijzen, en één vraag uit medewerker) zijn voor die variant nog niet beoordeeld.

De testaanpak moet zich ontwikkelen van deze opstarttest naar een vollediger verzameling testgevallen die een representatief beeld geeft van de antwoordkwaliteit. Daarvoor werken we aan meer testcapaciteit voor grotere testsets, een groter examen met criteria die specifiek zijn voor een testgeval, het nalopen van de toon tegen de gewenste toon, en het versimpelen van de antwoorden. Er zijn nu regelmatig lange antwoorden met meerdere bijzinnen.

Alle metingen

Elke meting staat op zijn eigen pagina en blijft daar staan. Vergelijk alleen metingen die dezelfde systemen naast elkaar leggen.