Wat is data labelling?
Data labelling is het voorzien van ruwe gegevens, zoals foto’s, teksten of geluidsfragmenten, van labels die beschrijven wat erin zit. Een foto krijgt het label “hond” of “kat”, een klantmail het label “klacht” of “vraag”. Die gelabelde voorbeelden zijn het lesmateriaal waarmee supervised machine learning-modellen leren: het model ziet duizenden voorbeelden met het juiste antwoord erbij en leert zo het patroon.
Hoe werkt het?
Eerst bepaal je welke labels er zijn en wat de criteria zijn. Daarna worden de voorbeelden gelabeld: van oudsher handmatig door mensen met labeltools, tegenwoordig steeds vaker semi-automatisch. Een AI-model doet een eerste voorzet en mensen controleren en corrigeren alleen de twijfelgevallen. Kwaliteitscontrole is cruciaal: laat je meerdere mensen dezelfde voorbeelden labelen, dan zie je waar de criteria onduidelijk zijn. De gouden regel blijft: de kwaliteit van de labels bepaalt de kwaliteit van het model. Inconsistente labels leveren een inconsistent model op.
Wat heb je eraan als bedrijf?
Wie een model op maat wil, ontdekt al snel dat het meeste werk in het labelen zit, niet in het trainen. Het goede nieuws: vaak labelt je organisatie al zonder het te beseffen. Elke e-mail die een medewerker in een map sleept, elke afgehandelde klacht met een categorie, elke goedgekeurde of afgekeurde aanvraag is een gelabeld voorbeeld. Die bestaande werkstroom is vaak de goedkoopste bron van trainingsdata.
Gerelateerde begrippen
Data labelling, ook wel annotation genoemd, levert labelled data op voor supervised learning. Wil je met minder labelwerk toe, kijk dan naar active learning.
Je hele organisatie AI-geletterd?
Bij elke incompany training krijgt iedereen in je organisatie toegang tot de e-learning AI Geletterdheid. In 90 tot 120 minuten leert elke medewerker wat AI is, wat je ermee kunt en hoe je er veilig mee werkt. Per rol en sector, met certificaat, zoals de EU AI Act vraagt.
Bekijk de trainingen →