Wat zijn evaluation metrics?
Evaluation metrics (evaluatiemaatstaven) zijn de cijfers waarmee je meet hoe goed een AI-model presteert. Zonder meetlat weet je niet of een model bruikbaar is, of het beter is dan een alternatief, en of het na verloop van tijd nog steeds goed werkt. Welke maatstaf je kiest hangt af van de taak en van wat een fout je kost.
Hoe werkt het?
Je test het model op data die het tijdens de training niet heeft gezien en vergelijkt de voorspellingen met de werkelijke uitkomsten. Voor classificatie (is dit spam of niet?) gebruik je maatstaven als accuracy (welk deel van alle voorspellingen klopt), precision (hoeveel van de positief gelabelde gevallen waren echt positief) en recall (hoeveel van de echte positieve gevallen heeft het model gevonden). De F1-score combineert die laatste twee. Voor voorspellingen van getallen, zoals omzet, kijk je naar de gemiddelde afwijking. Voor taalmodellen en chatbots zijn klassieke metrics vaak ontoereikend; daar wordt output beoordeeld op juistheid, bruikbaarheid en veiligheid, steeds vaker met een tweede model of menselijke beoordelaars als rechter.
Wat heb je eraan als bedrijf?
Eén getal zegt zelden alles. Stel dat een fraudedetectiemodel 99 procent accuracy haalt. Dat klinkt indrukwekkend, maar als in dit voorbeeld maar 1 procent van de transacties fraude is, haalt een model dat alles klakkeloos goedkeurt precies dezelfde score. Vraag een leverancier daarom altijd welke maatstaf is gebruikt en waarom die past bij jouw situatie: bij een medische screening weegt recall (niets missen) zwaarder, bij een spamfilter precision (geen echte mail wegfilteren).
Gerelateerde begrippen
De belangrijkste maatstaven hebben elk een eigen pagina: accuracy, precision, recall en de F-score. De resultaten zet je overzichtelijk in een confusion matrix.
Je hele organisatie AI-geletterd?
Bij elke incompany training krijgt iedereen in je organisatie toegang tot de e-learning AI Geletterdheid. In 90 tot 120 minuten leert elke medewerker wat AI is, wat je ermee kunt en hoe je er veilig mee werkt. Per rol en sector, met certificaat, zoals de EU AI Act vraagt.
Bekijk de trainingen →