Wat is latent semantic analysis?
Latent Semantic Analysis (LSA) is een klassieke techniek uit de tekstanalyse die verborgen betekenisverbanden tussen woorden en documenten blootlegt. Het idee: woorden die vaak in dezelfde soort teksten voorkomen, hebben waarschijnlijk met elkaar te maken. Zo kan LSA herkennen dat “auto” en “wagen” verwant zijn, ook al staat dat nergens expliciet.
Hoe werkt het?
LSA bouwt eerst een grote tabel met per document hoe vaak elk woord erin voorkomt. Die tabel wordt vervolgens wiskundig vereenvoudigd met een techniek die singular value decomposition (SVD) heet: ruis en details verdwijnen, de belangrijkste patronen blijven over. Elk woord en elk document krijgt daardoor een positie in een soort betekenisruimte. Woorden en documenten die dicht bij elkaar liggen, gaan over hetzelfde onderwerp, ook als ze niet letterlijk dezelfde woorden delen.
Wat heb je eraan als bedrijf?
LSA was jarenlang de standaard achter slimmere zoekfuncties die ook synoniemen begrijpen. Inmiddels is de techniek grotendeels ingehaald door moderne embeddings uit neurale netwerken, die betekenis veel preciezer vastleggen en de basis vormen van hedendaagse semantische zoeksystemen. Voor de meeste bedrijven is LSA daarom vooral achtergrondkennis: het helpt om te begrijpen waar het idee “betekenis als positie in een ruimte” vandaan komt.
Gerelateerde begrippen
LSA is de voorloper van moderne embeddings en word embeddings, en wordt vaak genoemd naast latent Dirichlet allocation (LDA). De toepassing zie je terug in semantic search.
Je hele organisatie AI-geletterd?
Bij elke incompany training krijgt iedereen in je organisatie toegang tot de e-learning AI Geletterdheid. In 90 tot 120 minuten leert elke medewerker wat AI is, wat je ermee kunt en hoe je er veilig mee werkt. Per rol en sector, met certificaat, zoals de EU AI Act vraagt.
Bekijk de trainingen →