Wat is een corpus?
Een corpus (meervoud: corpora) is een grote, georganiseerde verzameling tekst of spraak die wordt gebruikt om taalmodellen te trainen en te testen. Het is letterlijk het leesvoer van een AI-model: alles wat een taalmodel over taal weet, heeft het geleerd uit zijn trainingscorpus.
Hoe werkt het?
Een corpus kan van alles zijn: webpagina’s, boeken, nieuwsartikelen, klantgesprekken of transcripties van gesproken taal. Soms is het ruwe tekst, soms is het geannoteerd: voorzien van extra labels zoals grammaticale structuur of sentiment. Hoe groter en gevarieerder het corpus, hoe breder het model leert. Maar kwaliteit telt zwaarder dan kwantiteit: een corpus vol fouten, vooroordelen of verouderde informatie levert een model op met dezelfde gebreken. Grote taalmodellen worden getraind op corpora van vele terabytes aan tekst, onder meer afkomstig van het openbare web.
Wat heb je eraan als bedrijf?
Voor de meeste bedrijven is dit vooral achtergrondkennis, maar het wordt concreet zodra je AI op eigen kennis laat draaien. Je handleidingen, offertes, e-mails en kennisbank vormen samen jouw bedrijfscorpus. Wil je een chatbot of assistent die jouw producten echt kent, dan bepaalt de kwaliteit van dat corpus het resultaat. Opgeruimde, actuele documentatie is daarmee letterlijk AI-voorbereiding.
Gerelateerde begrippen
Een corpus is de grondstof voor large language models en andere vormen van machine learning. Het toevoegen van labels aan een corpus heet annotation of data labelling.
Je hele organisatie AI-geletterd?
Bij elke incompany training krijgt iedereen in je organisatie toegang tot de e-learning AI Geletterdheid. In 90 tot 120 minuten leert elke medewerker wat AI is, wat je ermee kunt en hoe je er veilig mee werkt. Per rol en sector, met certificaat, zoals de EU AI Act vraagt.
Bekijk de trainingen →