Kwaliteit in cijfers

Hoe weet je dat Gem werkt? En wordt Gem er echt beter op? We meten het, met echte inwonersvragen.

We kijken niet naar één aspect, maar naar een samenhangend geheel — naar wat er wél in een antwoord moet staan, én naar wat er juist níet in thuishoort. Op deze pagina verzamelen we de metingen van onze antwoordkwaliteit. Elke meting vergelijkt systemen op een vaste set criteria. Op de pagina kwaliteitscriteria gaan we dieper in op de afzonderlijke criteria.

Wat is kwaliteit precies? Zeven criteria

  • Juistheid Klopt het antwoord feitelijk?
  • Behulpzaamheid Helpt het de inwoner echt verder?
  • Eenvoud Is het kort en begrijpelijk?
  • Spelling & grammatica Is het foutloos geschreven?
  • Toon Past de toon bij een gemeente?
  • Traceerbaarheid Verwijst het antwoord naar een controleerbare bron?
  • Veiligheid Is het antwoord veilig en weigert het waar nodig?

Dit zijn de zeven criteria die we op dit moment automatisch scoren.

Nieuwste rapport

Antwoordkwaliteit bij meer vragen

Examen 30 augustus 2026

In deze testronde hebben we het aantal examenvragen flink uitgebreid: van 51 naar 236. We hebben veel examenvragen toegevoegd waar Gem geen vast antwoord voor heeft. Zo meten we extra sterk op genereren: kan Gem goed en correct antwoorden genereren uit de kennisbank?

Gewogen totaal Gem 1.0 6,6 Gem 2.0 hybride 8,9 Puur generatief 8,1

Lees de volledige rapportage →

Alle metingen

Elke meting staat op zijn eigen pagina en blijft daar staan. Vergelijk alleen metingen die dezelfde systemen naast elkaar leggen.

Waarom dit telt voor jouw gemeente

Antwoordkwaliteit is geen technisch detail, maar een kwestie van betrouwbaarheid en reputatie. Eén slecht antwoord ondermijnt het vertrouwen van een inwoner in je hele digitale dienstverlening.

Daarom staat bij Gem degelijkheid voorop: liever een eerlijk “dit zoek ik even voor je uit” met een medewerker erbij, dan een vlot antwoord dat niet klopt. Je krijgt geen chatbot die “wel iets zegt”, maar een assistent waarvan de antwoordkwaliteit gedefinieerd, gemeten en navolgbaar is.

Generatieve AI

Om ook de lastige, nog niet herkende vragen beter te beantwoorden, werken we aan de inzet van generatieve AI. Dat blijft een zorgvuldige afweging: we zetten het alleen in als het de antwoorden aantoonbaar verbetert.

Daarom testen we meerdere taalmodellen naast elkaar — waaronder GPT-NL, het Nederlandse taalmodel voor de publieke sector — en vergelijken we de kwaliteitsverschillen met praktijkgerichte examens: een set vooraf geselecteerde vragen met bijbehorende goede antwoorden. Wie mag straks antwoorden geven aan inwoners? Dat bepalen we niet op gevoel, maar op resultaat.

De criteria controleren deden we lange tijd vooral handmatig, aangevuld met meldingen van inwoners en kritische onderzoekers. Waardevol, maar tijdrovend. Daarom automatiseren we steeds meer controles met een testsysteem dat antwoorden analyseert en beoordeelt aan de hand van diezelfde examens. Zo maken we kwaliteit meetbaar, schaalbaar én consistent — zonder de menselijke blik los te laten.

De uitkomsten van die examens publiceren we periodiek.