Wat is Latent Dirichlet Allocation?
Latent Dirichlet Allocation (LDA) is een statistische techniek die verborgen onderwerpen ontdekt in een grote verzameling teksten. Het model gaat ervan uit dat elk document een mengsel is van meerdere onderwerpen, en dat elk onderwerp wordt gekenmerkt door bepaalde woorden die er vaak bij voorkomen. LDA is de bekendste vorm van topic modeling en stamt uit 2003.
Hoe werkt het?
Je geeft LDA een stapel documenten en vertelt vooraf hoeveel onderwerpen het moet zoeken, bijvoorbeeld tien. Het algoritme wijst woorden eerst willekeurig aan onderwerpen toe en verbetert die toewijzing daarna stap voor stap, op basis van welke woorden vaak samen voorkomen. Het resultaat: per onderwerp een lijst kenmerkende woorden (bijvoorbeeld “factuur, betaling, termijn” als onderwerp facturering) en per document een verdeling over die onderwerpen. De onderwerpen krijgen geen naam; die interpretatie doe je zelf.
Wat heb je eraan als bedrijf?
LDA is handig als je snel wilt weten waar grote hoeveelheden tekst over gaan zonder alles te lezen: duizenden klantreviews, supporttickets of open antwoorden uit een enquête. Eerlijk is eerlijk: voor veel van dit soort taken gebruiken bedrijven inmiddels grote taalmodellen, die teksten direct kunnen samenvatten en labelen. LDA blijft relevant als goedkope, transparante methode voor heel grote datasets, maar voor de meeste MKB-bedrijven is dit vooral achtergrondkennis.
Gerelateerde begrippen
LDA is een vorm van unsupervised learning en wordt vaak vergeleken met latent semantic analysis (LSA). Het hoort bij het bredere veld van text analytics en werkt op basis van latent variable models.
Je hele organisatie AI-geletterd?
Bij elke incompany training krijgt iedereen in je organisatie toegang tot de e-learning AI Geletterdheid. In 90 tot 120 minuten leert elke medewerker wat AI is, wat je ermee kunt en hoe je er veilig mee werkt. Per rol en sector, met certificaat, zoals de EU AI Act vraagt.
Bekijk de trainingen →