Kwaliteit yn sifers

Hoe witsto dat Gem wurket? En wurdt Gem der echt better op? Wy mjitte it, mei echte ynwennersfragen.

Wy sjogge net nei ien aspekt, mar nei in gearhingjend gehiel — nei wat der wèl yn in antwurd stean moat, én nei wat der krekt net yn thúshearret. Op dizze side sammelje wy de mjittingen fan ús antwurdkwaliteit. Elke mjitting fergeliket systemen op in fêste set kritearia. Op de side kwaliteitskritearia geane wy djipper yn op de aparte kritearia.

Wat is kwaliteit krekt? Sân kritearia

  • Krektens Kloppet it antwurd feitlik?
  • Helpfeardigens Helpt it de ynwenner echt fierder?
  • Ienfâld Is it koart en begryplik?
  • Stavering & grammatika Is it flaterfrij skreaun?
  • Toan Past de toan by in gemeente?
  • Neifolgberens Ferwiist it antwurd nei in kontrolearbere boarne?
  • Feiligens Is it antwurd feilich en wegeret it wêr't dat nedich is?

Dit binne de sân kritearia dy't wy op dit stuit automatysk skoare.

Nijste rapport

Antwoordkwaliteit bij meer vragen

Examen 30 augustus 2026

In deze testronde hebben we het aantal examenvragen flink uitgebreid: van 51 naar 236. We hebben veel examenvragen toegevoegd waar Gem geen vast antwoord voor heeft. Zo meten we extra sterk op genereren: kan Gem goed en correct antwoorden genereren uit de kennisbank?

Woegen totaal Gem 1.0 6,6 Gem 2.0 hybride 8,9 Puur generatief 8,1

Lês de folsleine rapportaazje →

Alle mjittingen

Elke mjitting stiet op syn eigen side en bliuwt dêr stean. Fergelykje allinne mjittingen dy't deselde systemen neistinoar lizze.

Wêrom't dit telt foar dyn gemeente

Antwurdkwaliteit is gjin technysk detail, mar in kwestje fan betrouberens en reputaasje. Ien min antwurd ûndermynt it fertrouwen fan in ynwenner yn dyn hiele digitale tsjinstferliening.

Dêrom stiet by Gem deeglikheid foarop: leaver in earlik “dit siikje ik even foar dy út” mei in meiwurker derby, as in flot antwurd dat net kloppet. Do krijst gjin chatbot dy't “wol wat seit”, mar in assistint wêrfan de antwurdkwaliteit definiearre, mjitten en neifolchber is.

Generative AI

Om ek de dreege, noch net werkende fragen better te beäntwurdzjen, wurkje wy oan de ynset fan generative AI. Dat bliuwt in soarchfâldige ôfwaging: wy sette it allinne yn as it de antwurden oantoanber ferbetteret.

Dêrom teste wy meardere taalmodellen neistinoar — wêrûnder GPT-NL, it Nederlânske taalmodel foar de publike sektor — en fergelykje wy de kwaliteitsferskillen mei praktykrjochte eksamens: in set foarôf selektearre fragen mei bybehearrende goede antwurden. Wa mei aanst antwurden jaan oan ynwenners? Dat bepale wy net op gefoel, mar op resultaat.

De kritearia kontrolearje diene wy lange tiid benammen mei de hân, oanfolle mei meldingen fan ynwenners en krityske ûndersikers. Weardefol, mar tiidrôvjend. Dêrom automatisearje wy hieltyd mear kontrôles mei in testsysteem dat antwurden analysearret en beoardielet oan de hân fan deselde eksamens. Sa meitsje wy kwaliteit mjitber, skaalber én konsistint — sûnder de minsklike blik los te litten.

De útkomsten fan dy eksamens publisearje wy periodyk.