Antwoordkwaliteit bij meer vragen

Examen 30 augustus 2026.

In deze testronde hebben we het aantal examenvragen flink uitgebreid: van 51 naar 236. We hebben veel examenvragen toegevoegd waar Gem geen vast antwoord voor heeft. Zo meten we extra sterk op genereren: kan Gem goed en correct antwoorden genereren uit de kennisbank? Ook voegden we veel situaties toe waarbij Gem een verhelderende vraag moet stellen in plaats van inhoudelijk antwoorden.

Zowel Gem als de examens zijn verbeterd op de bevindingen van de vorige testronde. Ook hebben we een assistent-variant toegevoegd die alleen de webcontent en een taalmodel tot zijn beschikking heeft, en dus geen vaste antwoorden zoals Gem. Door deze wijzigingen is deze rapportage niet 1 op 1 te vergelijken met de vorige rapportage.

Gem 1.0

6,6

Gem met vaste antwoorden, zonder generatieve AI

inhoudelijk 5,6
vorm en stijl 9,9
125 van de 236 antwoorden geslaagd

Gem 2.0 Hybride

8,9

Vaste antwoorden waar gewenst; generatieve AI waar nodig

inhoudelijk 8,7
vorm en stijl 9,7
213 van de 236 antwoorden geslaagd

Puur generatief

8,1

Alleen webcontent en een taalmodel (LLM), zoals de meeste chatbots werken

inhoudelijk 7,8
vorm en stijl 9,5
196 van de 236 antwoorden geslaagd

Het grote getal is het rapportcijfer over alle zeven examenonderdelen. Ze worden als volgt gewogen: Juistheid 35%, behulpzaamheid 25%, traceerbaarheid 15%, eenvoud 10%, spelling 5%, toon 5% en veiligheid 5%. De rapportcijfers lopen van 0 tot 10; verschillen van een paar tienden zijn ruis.

In het kort

  • Hybride scoort het beste doordat het geen uitschieters maakt; niet naar beneden en niet naar boven. Het laagste cijfer voor een vraag is een 6,8. Door de vaste antwoorden scoort Hybride goed en precies op complexe, veelgestelde vragen, en bij het genereren op weinig gestelde vragen maakt Hybride geen grote uitglijders.
  • Op doorvragen is Gem 1.0 nog steeds de beste. Gem 2.0 gaat al beter om met doorvragen in plaats van direct antwoorden, maar geeft soms toch nog inhoudelijk antwoord door te 'gokken' waar de vraag over gaat. Dit is bekend gedrag van taalmodellen en vraagt om duidelijke instructies.
  • Qua schrijfstijl lopen de varianten niet ver uit elkaar. Alle drie scoren ze goed, met cijfers tussen 9,6 en 9,9 op taalniveau, spelling en toon.

Kwaliteit van inhoud

In deze grafiek zie je hoe de verschillende varianten scoren op criteria die met de inhoud van het antwoord te maken hebben: juistheid, behulpzaamheid, traceerbaarheid (link naar bron) en veiligheid (beleefd weigeren bij ongepaste vragen).

Gestapelde staafgrafiek van de scores op juistheid, behulpzaamheid, traceerbaarheid en veiligheid. Gem 1.0 komt gemiddeld op 6,6, Gem 2.0 Hybride op 8,9 en Puur generatief op 8,2. De cijfers staan in de tabel hieronder.

De lengte van de balk is het gemiddelde van de vier onderdelen; elk blokje is een score gedeeld door vier.

Score per onderdeel, 0–10 Gem 1.0 Gem 2.0 Hybride Puur generatief
Juistheid 4,3 8,8 7,8
Behulpzaamheid 6,9 8,2 7,4
Traceerbaarheid 8,5 7,6
Veiligheid 8,4 10,0 10,0
Gemiddelde = lengte van de balk 6,6 8,9 8,2
Gewogen Juistheid 35 · Behulpzaamheid 25 · Traceerbaarheid 15 · Veiligheid 5 5,6 8,7 7,8

Kwaliteit van vorm en stijl

In deze grafiek zie je hoe de verschillende varianten scoren op criteria die met vorm en stijl te maken hebben: eenvoud (B1 taalniveau), spelling, grammatica en toon.

Gestapelde staafgrafiek van de scores op eenvoud, spelling en grammatica, en toon. Gem 1.0 komt gemiddeld op 9,9, Gem 2.0 Hybride op 9,7 en Puur generatief op 9,6. De cijfers staan in de tabel hieronder.

Score per onderdeel, 0–10 Gem 1.0 Gem 2.0 Hybride Puur generatief
Eenvoud (B1) 10,0 9,4 9,3
Spelling & grammatica 9,7 9,9 9,8
Toon 10,0 9,9 9,8
Gemiddelde = lengte van de balk 9,9 9,7 9,6
Gewogen Eenvoud (B1) 10 · Spelling & grammatica 5 · Toon 5 9,9 9,7 9,5

Belangrijkste verbeterpunten

Voor het meetsysteem

  • Zwaarder laten meewegen als een antwoord een verzonnen feit bevat.

Voor Gem

  • Meer en duidelijkere instructies voor het stellen van verhelderende vragen.

Twee voorbeelden uit het genereren

Verrassend goed — de vraag was: “op ons zomerfeest speelt een band met eigen geluidsinstallatie. moet ik daar iets voor regelen?”

De vraag noemt de regeling niet. Gem moet zelf herkennen dat hier een ontheffing voor harde muziek speelt, de regel toepassen op dit geval, én de uitzondering noemen waardoor hij soms niet geldt.

✔️ Gem 2.0 Hybride: “Als je tijdens een feest hardere muziek wilt draaien, heb je een ontheffing nodig. Omdat de band een eigen geluidsinstallatie meeneemt, moet je deze ontheffing aanvragen. […] Je hebt geen aparte ontheffing nodig als je al een evenementenvergunning aanvraagt. […] De ontheffing is gratis. Je moet de ontheffing minimaal 4 weken van tevoren aanvragen.” — elke bewering is terug te vinden in de bron.

✔️ Puur generatief doet hetzelfde, alleen de aanvraagtermijn is minder volledig.

Gem 1.0: “Met deze vraag kan ik je helaas nog niet helpen.”

Waar het risico zit — de vraag was: “wat komt er in de oude gevangenis aan het Wolvenplein?”

Eén verzonnen getal tussen kloppende feiten, en de score wijst er nauwelijks op.

✔️ Gem 2.0 Hybride: “er komt een hotel met een bijzonder, thematisch concept” — precies wat de bron zegt, zonder aantal kamers, want dat staat er niet in.

Puur generatief: “In de voormalige gevangenis aan het Wolvenplein komen verschillende voorzieningen: een hotel met 50 kamers, 10 appartementen voor tijdelijk verblijf, horeca, werkplekken, een buurtvoorziening.” — het aantal van 50 hotelkamers staat niet in de bron en is verzonnen. Het antwoord is verder correct, en daardoor valt het verzinsel in de cijfers nauwelijks op.

Hoe is het gemeten

Drie varianten, 236 vragen, 708 antwoorden, afgenomen op 30 augustus 2026. Beoordeeld met 10132 losse beoordelingen, waarvan 5200 beoordelingen door een taalmodel (llm as a judge — deze ronde Claude) en de rest deterministische beoordelingen.

Het criterium traceerbaarheid is voor Gem 1.0 buiten beschouwing gelaten omdat de bronvermelding bij deze antwoorden nog niet goed gemeten kan worden. We werken dit uit zodat we dit in een volgende test wél kunnen meten.

De variant 'Puur generatief' is gewijzigd ten opzichte van de vorige rapportage. In de vorige rapportage kon deze variant, naast de webcontent van de gemeente, ook de vaste antwoorden als inspiratiebron gebruiken. De variant in deze test kan dat niet, en werkt daarmee meer zoals andere chatbots. De cijfers zijn daarom niet 1 op 1 te vergelijken met de vorige rapportage.

Wat we per criterium precies bedoelen en hoe we het meten, staat op De criteria en hoe we ze meten. Alle metingen op een rij staan op Kwaliteit in cijfers.


Wil je hier dieper op ingaan voor jouw gemeente? Vraag een gesprek aan.

← Home