Werken aan betere antwoordkwaliteit

Gem 1.0 draait al jaren bij een groeiend aantal gemeenten en beantwoordt veelgestelde vragen betrouwbaar vanuit een vraag-antwoordbibliotheek. Tegelijkertijd is Gem minder sterk bij anders geformuleerde vragen of vragen waarvoor geen passend antwoord beschikbaar is.

Daarom onderzoeken we hoe generatieve AI de antwoordkwaliteit kan verbeteren. Na het leggen van de technische basis in de eerste helft van 2026, testen we nu drie Gemvarianten. Daarover meer in dit artikel.

stacked-chart-600px

Figuur 1: Gem 2.0 Hybride biedt voor meerdere vraagcategorieën tezamen per saldo het beste resultaat.

Gem getest in drie varianten

Gem 1.0 is de versie die dagelijks wordt gebruikt en vormt de basis waarmee we de kwaliteit van nieuwe varianten vergelijken.

Momenteel ontwikkelen we Gem 2.0 met generatieve AI die gebruikmaakt van gemeentelijke kennisbronnen, zoals websites, documenten en de vraag antwoordbibliotheek. We onderzoeken twee varianten:

  • Gem 2.0 Hybride: Gem 1.0 blijft veelgestelde vragen afhandelen, terwijl generatieve AI wordt ingezet voor andere vragen.
  • Gem 2.0 Puur Generatief: alle antwoorden worden gegenereerd met generatieve AI, zoals bij de meeste moderne chatbots.

Wat we allemaal natuurlijk al weten: Generatieve AI biedt nieuwe mogelijkheden om vragen beter te herkennen en antwoorden te genereren. Tegelijkertijd breng deze technologie ook risico’s met zich mee. Want met AI gegenereerde antwoorden kunnen fouten bevatten. Daarom willen we generatieve AI voor Gem pas inzetten als de resultaten aantoonbaar beter zijn dan die van Gem 1.0.

En… werkt het ook echt beter? Om dat te onderzoeken hebben we de antwoorden van Gem 1.0 vergeleken met die van beide Gem 2.0-varianten. De antwoorden zijn geautomatiseerd beoordeeld aan de hand van gedetailleerde kwaliteitscriteria. De eerste resultaten laten zien dat Gem 2.0 Hybride het beste presteert. Die combineert het beste van twee werelden: betrouwbare, vaste antwoorden op veelgestelde vragen en AI-gegenereerde antwoorden voor minder vaak voorkomende vragen.

De tests laten ook zien waar verbetering nodig is, zoals bij het stellen van verhelderende vragen en tijdig doorverwijzen naar een medewerker. Daar werken we nog aan. Maar ook willen we de geautomatiseerde meting verbeteren, zodat meetresultaten beter aansluiten bij wat menselijke beoordelaars zien. Daarnaast breiden we de set met testvragen stapsgewijs verder uit. Hierover vertellen we je meer tijdens de volgende Kwartaalupdate.

chart-600px

Figuur 2: Generatieve AI verbetert de antwoorden op minder vaak gestelde vragen (links), maar zorgt er ook voor dat Gem minder goed doorvraagt en doorverwijst naar een medewerker wanneer dat nodig is (rechts).

← Nieuws