Wat is k-means clustering?
k-Means clustering is een algoritme dat datapunten automatisch verdeelt in een vooraf gekozen aantal groepen (de “k” staat voor dat aantal). Punten die op elkaar lijken komen in dezelfde groep, zonder dat iemand vooraf vertelt welke groepen er zijn. Het is daarmee een vorm van unsupervised learning: het algoritme ontdekt zelf structuur in de data.
Hoe werkt het?
Het algoritme kiest eerst k willekeurige middelpunten in de data. Daarna wijst het elk datapunt toe aan het dichtstbijzijnde middelpunt, en verschuift het elk middelpunt naar het gemiddelde van de punten die erbij horen. Die twee stappen herhalen zich tot de middelpunten niet meer bewegen. Het resultaat: k groepen waarbinnen de punten zoveel mogelijk op elkaar lijken. Een aandachtspunt is dat je zelf het aantal groepen moet kiezen; daar bestaan hulpmethoden voor, maar het blijft deels een keuze van de gebruiker.
Wat heb je eraan als bedrijf?
De bekendste toepassing is klantsegmentatie: je laat het algoritme los op aankoopgedrag en ontdekt bijvoorbeeld dat je klantenbestand uiteenvalt in koopjesjagers, trouwe grootafnemers en incidentele kopers. Daar stem je vervolgens je marketing op af. Het werkt ook voor het groeperen van producten, het indelen van leveranciers of het opsporen van afwijkende transacties die in geen enkele groep passen. Veel BI- en marketingtools hebben deze functionaliteit ingebouwd, dus je hoeft er geen data scientist voor in dienst te hebben.
Gerelateerde begrippen
k-Means is de bekendste vorm van clustering, een techniek binnen unsupervised learning. Een alternatieve aanpak is hierarchical clustering, en het bredere analysegebied heet cluster analysis.
Je hele organisatie AI-geletterd?
Bij elke incompany training krijgt iedereen in je organisatie toegang tot de e-learning AI Geletterdheid. In 90 tot 120 minuten leert elke medewerker wat AI is, wat je ermee kunt en hoe je er veilig mee werkt. Per rol en sector, met certificaat, zoals de EU AI Act vraagt.
Bekijk de trainingen →