Naar de inhoud

AI & Identity · Nieuws van de dag

Benchmark

Wat is een AI-benchmark?

Een vaste set toetsvragen om AI-modellen met elkaar te vergelijken, zoals een examen voor software.

Gecontroleerd op · 2 bronnen

Wat het is

Een benchmark is een standaardtest: een verzameling vragen of taken met bekende goede antwoorden. Modellen maken dezelfde toets, en de score laat zien welk model beter is in bijvoorbeeld wiskunde, programmeren, redeneren of het volgen van instructies.

Bekende voorbeelden zijn SWE-bench (echte programmeerproblemen oplossen), GPQA (lastige wetenschapsvragen) en Humanity's Last Exam. Bij elke nieuwe modelaankondiging staat een tabel met zulke scores.

Een voorbeeld

Het is te vergelijken met de Cito-toets: iedereen maakt dezelfde opgaven, zodat je scores naast elkaar kunt leggen. En net als bij de Cito zegt een hoge score iets, maar niet alles over hoe goed iemand het in de praktijk doet.

Waar het tekortschiet

  • Als de toetsvragen online staan, kunnen ze in de trainingsgegevens belanden. Dan leert het model de antwoorden in plaats van de vaardigheid.
  • Makers kiezen vaak de benchmarks waarop ze goed scoren.
  • Een paar procentpunt verschil is in dagelijks gebruik vaak niet te merken.

Waarom het ertoe doet

Benchmarkscores staan in bijna elk bericht over een nieuw model. Wie weet hoe ze werken, laat zich minder snel imponeren door een tabel en kijkt naar wat een model voor de eigen taak doet.

In het nieuws

Hangt hiermee samen

Bronnen

  1. SWE-bench swebench.com
  2. Humanity's Last Exam lastexam.ai

Deze uitleg is geschreven door de redactie van RedFlare en op 25 september 2026 tegen deze bronnen nagelezen.

← Alle begrippen in de kennisbank