← Werom nei Kwaliteit

Rapport antwurdkwaliteit

Antwurdkwaliteit per kritearium: Gem 1.0 neist twa farianten fan Gem 2.0

Rooktest · net folslein útfierd

Hoe skoare de trije farianten op de fiif algemiene kwaliteitskritearia dy't foar elk antwurd jilde, likefolle hokker fraach der steld is? Deselde fragen gongen del by Gem 1.0 en by twa farianten fan Gem 2.0.

Skoares yn prosinten · kleur = skoarebân · it totaal is it gemiddelde fan de fiif kritearia, elk like swier meiteld.
Kritearium Gem 1.0 Gem 2.0 hybride Gem 2.0 suver generatyf
Krektens 93,3% 94,3% 93,1%
Helpfeardigens 62,4% 53,5% 77,8%
Ienfâld 65,7% 71,6% 67,8%
Stavering & grammatika 85,1% 90,9% 94,3%
Toan 54,9% 56,1% 69,8%
Woegen totaal 72,3% 73,3% 80,6%

Skoarebannen

  • 90–100%
  • 80–89%
  • 70–79%
  • 60–69%
  • < 60%
Wat betsjutte dizze kritearia?

Fiif kritearia dy't foar elk antwurd jilde, los fan de ynhâld fan de fraach.

Krektens
Docht it antwurd gjin ûnterjochte oannames oer de situaasje fan de fragesteller.
Helpfeardigens
Biedt it antwurd in konkrete folgjende stap of in manier om mear te witten te kommen.
Ienfâld
Gewoane wurden, koarte sinnen, aktive foarm, logyske opbou. Bestiet út fjouwer dielmjittingen.
Stavering & grammatika
Taalkundich flaterleas.
Toan
Profesjoneel-freonlik, do-foarm, empasy dêr't it nedich is.

Wat betsjut dit?

By alle trije farianten is Krektens it sterkste punt (93–94%) en Toan it swakste (55–70%): de antwurden brûke net konsekwint de winske do-foarm en misse wat empasy. Helpfeardigens ferskilt it dúdlikst tusken de farianten. Gem 2.0 suver generatyf skoart dêr 78%, rom boppe Gem 1.0 (62%) en Gem 2.0 hybride (54%, al is dat sifer op in lytsere stekproef basearre).

Gem 2.0 suver generatyf hat oer de folsleine set de heechste woegen totaalskoare (80,6 fan de 100). Gem 2.0 hybride stiet der op de 23 wól skoarde fragen better foar as Gem 1.0, mar dat is noch gjin útspraak oer de folsleine set fan 51.

Oer dizze mjitting

Testset
51 fragen út 9 eksamens. Elke skoare is it gemiddelde oer dy fragen.
Testopset
Test by de gemeente Utrecht, beoardiele troch in AI-beoardieler.
Gem 1.0
Werkenning mei net-generative AI en fêste antwurden op basis fan skripte logika.
Gem 2.0 hybride
Werkenning mei generative AI, fêste antwurden foar faak stelde fragen en generearre antwurden foar minder faak stelde fragen.
Gem 2.0 suver generatyf
Werkenning mei generative AI én alle beantwurding troch generative AI.

Lytse letterkes: metoade & foarbehâlden

Dizze opstarttest is net folslein útfierd fanwegen beheiningen yn it evaluaasjesysteem. De sifers binne dêrmei ûnder foarbehâld.

Gem 2.0 hybride is op 23 fan de 51 fragen skoard. De oare 28 fragen (meerinfo, sensitive, simple, tussenvragen, verwijzen, en ien fraach út medewerker) binne foar dy fariant noch net beoardiele.

De testoanpak moat him ûntwikkelje fan dizze opstarttest nei in folsleiner samling testgefallen dy't in represintatyf byld jout fan de antwurdkwaliteit. Dêrfoar wurkje wy oan mear testkapasiteit foar gruttere testsets, in grutter eksamen mei kritearia dy't spesifyk binne foar in testgefal, it neirinnen fan de toan tsjin de winske toan, en it ferienfâldigjen fan de antwurden. Der binne no geregeld lange antwurden mei meardere bysinnen.

Alle mjittingen

Elke mjitting stiet op syn eigen side en bliuwt dêr stean. Fergelykje allinne mjittingen dy't deselde systemen neistinoar lizze.