← Terug naar Kwaliteit

Rapport antwoordkwaliteit

Antwoordkwaliteit: Gem 1.0 vergeleken met Gem 2.0

Pilot · deelverzameling van vragen

We legden de oudere dialoogagent (Gem 1.0) naast de nieuwe GenAI-agent (Gem 2.0): zelfde gemeente, zelfde vragen, alleen de motor eronder verschilt.

Scores 0,000–1,000 · kleur = scoreband · Juistheid weegt 1,0, de overige criteria 0,6.
Criterium Gem 1.0 Gem 2.0
Juistheid 0,908 0,909
Behulpzaamheid 0,909 0,927
Eenvoud 0,714 0,733
Spelling & grammatica 0,978 1,000
Toon 0,826 0,860
Gewogen totaal 0,872 0,888

Scorebanden

  • 0,90–1,00
  • 0,80–0,89
  • 0,70–0,79
  • 0,60–0,69
  • < 0,60

Wat betekent dit?

De belangrijkste verschillen tussen deze versies zijn:

  • Gem 2.0 is beter in complexe vragen, bijvoorbeeld als het gaat om co-ouderschap.
  • Gem 1.0 is beter bij ruisvragen en informele bewoordingen (zoals “blabla…”, “hoi, ik wil…”).

Over deze meting

Testset
100 vragen uit 12 categorieën van de veelgestelde vragen. Elke score is het gemiddelde over die vragen.
Criteria
Criteria en verwachte antwoorden zijn nog niet geoptimaliseerd naar maximale overeenkomst met menselijke beoordelaars. Het criterium “juistheid” is nu algemeen en eenvoudig gehouden.

Kleine lettertjes: methode & voorbehouden

Pilot op een deelverzameling: deze run is niet zonder meer representatief voor alle onderwerpen of alle gemeenten.

Alle metingen

Elke meting staat op zijn eigen pagina en blijft daar staan. Vergelijk alleen metingen die dezelfde systemen naast elkaar leggen.