Wat is cross-validation?
Cross-validation is een testmethode waarmee je controleert of een machine learning-model ook goed werkt op gegevens die het nog nooit heeft gezien. In plaats van één keer testen op één testset, test je het model meerdere keren op steeds andere stukken van je data. Dat geeft een veel betrouwbaarder beeld van de werkelijke prestaties.
Hoe werkt het?
De bekendste variant is k-fold cross-validation. Je verdeelt de dataset in bijvoorbeeld vijf gelijke delen (vouwen). Het model traint op vier delen en wordt getest op het vijfde. Dat herhaal je vijf keer, waarbij elk deel één keer als testset dient. Het gemiddelde van de vijf testscores is je eindoordeel. Zo voorkom je dat een toevallig gunstige of ongunstige verdeling van de data een vertekend beeld geeft, en zie je sneller of een model overfit: te goed presteert op trainingsdata en slecht op nieuwe data.
Wat heb je eraan als bedrijf?
Dit is vooral kennis voor wie modellen bouwt of laat bouwen, maar als opdrachtgever is het een goede controlevraag. Stel dat een leverancier belooft dat zijn voorspelmodel 95 procent nauwkeurig is. Vraag dan hoe dat getest is. Een score uit cross-validation is geloofwaardiger dan een score op de trainingsdata zelf. Het is het verschil tussen een proefexamen met nieuwe vragen en een examen waarvan je de antwoorden al kende.
Gerelateerde begrippen
Cross-validation helpt overfitting opsporen en hoort bij het evalueren van machine learning-modellen, vaak in combinatie met metrieken zoals accuracy en de confusion matrix.
Je hele organisatie AI-geletterd?
Bij elke incompany training krijgt iedereen in je organisatie toegang tot de e-learning AI Geletterdheid. In 90 tot 120 minuten leert elke medewerker wat AI is, wat je ermee kunt en hoe je er veilig mee werkt. Per rol en sector, met certificaat, zoals de EU AI Act vraagt.
Bekijk de trainingen →