Benchmark
Wat is een AI-benchmark?
Een vaste set toetsvragen om AI-modellen met elkaar te vergelijken, zoals een examen voor software.
Gecontroleerd op · 2 bronnen
Wat het is
Een benchmark is een standaardtest: een verzameling vragen of taken met bekende goede antwoorden. Modellen maken dezelfde toets, en de score laat zien welk model beter is in bijvoorbeeld wiskunde, programmeren, redeneren of het volgen van instructies.
Bekende voorbeelden zijn SWE-bench (echte programmeerproblemen oplossen), GPQA (lastige wetenschapsvragen) en Humanity's Last Exam. Bij elke nieuwe modelaankondiging staat een tabel met zulke scores.
Een voorbeeld
Het is te vergelijken met de Cito-toets: iedereen maakt dezelfde opgaven, zodat je scores naast elkaar kunt leggen. En net als bij de Cito zegt een hoge score iets, maar niet alles over hoe goed iemand het in de praktijk doet.
Waar het tekortschiet
- Als de toetsvragen online staan, kunnen ze in de trainingsgegevens belanden. Dan leert het model de antwoorden in plaats van de vaardigheid.
- Makers kiezen vaak de benchmarks waarop ze goed scoren.
- Een paar procentpunt verschil is in dagelijks gebruik vaak niet te merken.
Waarom het ertoe doet
Benchmarkscores staan in bijna elk bericht over een nieuw model. Wie weet hoe ze werken, laat zich minder snel imponeren door een tabel en kijkt naar wat een model voor de eigen taak doet.
In het nieuws
- Google DeepMind introduceert Gemini 4 Argon met 1 miljoen outputtokens
- Nieuwe AI-modellen verhogen risico op cyberaanvallen
-
OpenAI lanceert GPT-6.1 Sol met lagere kosten en verbeterde prestaties
- NVIDIA Kumo Tabular: Nieuwe standaard voor tabulaire voorspellingen
- Anthropic lanceert Claude Sonnet 5.5 met verbeterde snelheid en kosten
-
Anthropic introduceert Claude Sonnet 5.5 met verbeterde prestaties en lagere kosten
Hangt hiermee samen
Bronnen
- SWE-bench swebench.com
- Humanity's Last Exam lastexam.ai
Deze uitleg is geschreven door de redactie van RedFlare en op 25 september 2026 tegen deze bronnen nagelezen.