Wat zijn adversarial examples?
Adversarial examples zijn invoergegevens die opzettelijk en heel subtiel zijn aangepast om een AI-model te misleiden. Voor een mens ziet de aangepaste afbeelding of tekst er vrijwel identiek uit, maar het model trekt er ineens een totaal verkeerde conclusie uit. Ze leggen daarmee een fundamentele kwetsbaarheid van machine learning bloot.
Hoe werkt het?
Een aanvaller voegt kleine, gerichte verstoringen toe aan normale data, precies berekend op de zwakke plekken van het model. Klassieke voorbeelden: een paar stickers op een stopbord waardoor een zelfrijdende auto het als snelheidsbord leest, of een minimaal bewerkte foto waardoor gezichtsherkenning de verkeerde persoon aanwijst. Bij taalmodellen bestaat een verwante aanvalsvorm: prompt injection, waarbij verborgen instructies in een tekst of webpagina het model ander gedrag opdringen.
Wat heb je eraan als bedrijf?
Voor de meeste MKB-bedrijven is dit vooral een les in risicobewustzijn: AI-systemen kunnen op manieren falen die voor mensen onzichtbaar zijn. Gebruik je AI voor beveiliging, fraudedetectie of toegangscontrole, vraag je leverancier dan hoe het systeem is getest op dit soort manipulatie. De EU AI Act stelt voor hoog-risico-systemen eisen aan robuustheid en cyberbeveiliging, juist vanwege dit soort aanvallen.
Gerelateerde begrippen
Adversarial examples zijn een aanvalsvorm op systemen gebouwd met machine learning en deep learning. Niet te verwarren met de GAN, waar “adversarial” slaat op twee netwerken die elkaar trainen. Zie ook responsible AI.
Je hele organisatie AI-geletterd?
Bij elke incompany training krijgt iedereen in je organisatie toegang tot de e-learning AI Geletterdheid. In 90 tot 120 minuten leert elke medewerker wat AI is, wat je ermee kunt en hoe je er veilig mee werkt. Per rol en sector, met certificaat, zoals de EU AI Act vraagt.
Bekijk de trainingen →