Wat zijn similarity measures?
Similarity measures (gelijkenismaten) zijn wiskundige methoden om uit te drukken hoe sterk twee dingen op elkaar lijken. Dat kunnen teksten zijn, klantprofielen, producten of afbeeldingen. De uitkomst is een getal: hoe hoger de score, hoe groter de gelijkenis. Computers begrijpen geen betekenis uit zichzelf, dus zo’n maat is de manier waarop een AI-systeem kan beslissen dat “factuur” en “rekening” dichter bij elkaar liggen dan “factuur” en “fiets”.
Hoe werkt het?
Eerst worden de objecten omgezet in getallenreeksen, zogeheten embeddings of vectoren. Daarna berekent een formule de afstand of de hoek tussen die reeksen. De bekendste varianten zijn cosinusgelijkenis (de hoek tussen twee vectoren, veel gebruikt voor tekst), euclidische afstand (de rechte lijn tussen twee punten, veel gebruikt bij numerieke data en clustering) en Jaccard-gelijkenis (de overlap tussen twee verzamelingen, handig bij categorieën of tags). Welke maat het beste werkt, hangt af van het soort data.
Wat heb je eraan als bedrijf?
Similarity measures zitten onder de motorkap van veel tools die je dagelijks gebruikt. Een webshop die “klanten die dit kochten, kochten ook” toont, een zoekfunctie die relevante documenten vindt ook als de zoekwoorden net anders zijn, of een AI-assistent die de juiste passage uit je kennisbank ophaalt: ze leunen allemaal op gelijkenisberekeningen. Ook bij het opsporen van dubbele klantrecords of vergelijkbare supporttickets is dit de techniek erachter.
Gerelateerde begrippen
Similarity measures vormen de basis van semantic search en clustering, en werken op embeddings in een vector space model. Zie ook similarity en correlatie voor het verschil met statistische samenhang.
Je hele organisatie AI-geletterd?
Bij elke incompany training krijgt iedereen in je organisatie toegang tot de e-learning AI Geletterdheid. In 90 tot 120 minuten leert elke medewerker wat AI is, wat je ermee kunt en hoe je er veilig mee werkt. Per rol en sector, met certificaat, zoals de EU AI Act vraagt.
Bekijk de trainingen →