Wat is overfitting?
Overfitting is een klassieke valkuil in machine learning: het model past zich zó precies aan de trainingsdata aan dat het ook de ruis en toevalligheden uit die data leert. Op de trainingsdata scoort het dan uitstekend, maar op nieuwe gegevens presteert het slecht. Vergelijk het met een student die de antwoorden van het oefenexamen uit zijn hoofd leert in plaats van de stof te begrijpen: op het echte examen valt hij door de mand.
Hoe ontstaat het?
Overfitting ontstaat vooral bij een combinatie van een complex model en weinig data: het model heeft dan genoeg “geheugen” om elke uitzondering te onthouden in plaats van algemene patronen te leren. Ook te lang doortrainen vergroot het risico. Je herkent het aan een groeiend gat tussen de score op trainingsdata en de score op een aparte testset.
Hoe voorkom je het?
De belangrijkste remedies: meer of gevarieerdere trainingsdata, een eenvoudiger model, op tijd stoppen met trainen (early stopping), regularisatie (een ingebouwde rem op te complexe oplossingen) en het model altijd valideren op data die het nog nooit heeft gezien, bijvoorbeeld via cross-validation.
Wat heb je eraan als bedrijf?
Dit is hét begrip om kritisch te zijn op mooie cijfers. Stel dat een leverancier “99 procent nauwkeurigheid” claimt. Vraag dan altijd: gemeten op welke data? Op de trainingsdata zegt dat niets. Een model dat in de demo schittert maar in de praktijk tegenvalt, is vaak een geval van overfitting.
Gerelateerde begrippen
Het tegenovergestelde probleem heet underfitting; de balans daartussen is de bias-variance tradeoff. Betrouwbaar testen doe je met cross-validation en een goed samengestelde training set.
Je hele organisatie AI-geletterd?
Bij elke incompany training krijgt iedereen in je organisatie toegang tot de e-learning AI Geletterdheid. In 90 tot 120 minuten leert elke medewerker wat AI is, wat je ermee kunt en hoe je er veilig mee werkt. Per rol en sector, met certificaat, zoals de EU AI Act vraagt.
Bekijk de trainingen →