Data readiness voor AI:
wat moet eerst, wat mag rommelig blijven

AI-projecten stranden zelden op techniek en vaak op data die niet vindbaar of actueel is. Vijf checklist-vragen en een volgorde die werkt, zonder datawarehouse-project.

Waarom data de eerste vraag is, niet AI

AI is zo goed als de informatie waar het bij kan. Een taalmodel dat je offertes moet helpen schrijven maar geen toegang heeft tot je oude offertes, verzint er een. Een chatbot die je retourvoorwaarden niet kan vinden, geeft een generiek antwoord dat net niet klopt. Het overgrote deel van de mislukte AI-projecten strandt niet op de techniek, maar op data die niet vindbaar, niet actueel of niet compleet was.

Het goede nieuws: data readiness is geen miljoenenproject. Voor de meeste MKB-toepassingen gaat het om een paar gerichte vragen en een paar weken opruimen, niet om een datawarehouse van een jaar.

De checklist: vijf vragen voordat je begint

Loop deze vragen langs voor de afdeling of het proces waar je AI wilt inzetten. Niet voor de hele organisatie tegelijk, dat is de klassieke manier om nooit te beginnen.

  1. Waar staat de data? Weet je in welke systemen de relevante informatie zit: SharePoint, Google Drive, je CRM, je ERP, mailboxen? Als het antwoord “overal en nergens” is, begin je daar.
  2. Is het digitaal en doorzoekbaar? Gescande PDF’s zonder tekstlaag, foto’s van whiteboards en kennis die alleen in hoofden zit, tellen niet mee. AI kan er pas iets mee als het tekst is.
  3. Is het actueel? Een map met zeven versies van hetzelfde handboek is gevaarlijker dan geen handboek: de AI kan de verkeerde pakken. Eén actuele versie per document is het doel.
  4. Mag de AI erbij? Staat er persoonsgevoelige informatie tussen? Salarisgegevens, medische data, klantdossiers? Dan bepaal je vooraf wat wel en niet ontsloten wordt, niet achteraf.
  5. Wie is eigenaar? Iemand moet kunnen zeggen: dit document is leidend, dat mag weg. Zonder eigenaar veroudert elke opgeschoonde dataset binnen een half jaar terug naar chaos.

Hoe rommelig mag het zijn?

Rommeliger dan je denkt. Moderne AI-technieken, zoals Retrieval-Augmented Generation, kunnen prima overweg met gewone Word-documenten, PDF’s en e-mails. Je hoeft je data niet eerst in een perfecte database te gieten.

SituatieAI-klaar?Wat eerst
Documenten in SharePoint of Drive, redelijk geordendJaNiets, beginnen
Documenten verspreid, veel dubbele versiesBijna1-2 weken: dubbelen weg, één bron per onderwerp
Kennis in mailboxen en losse Excel-bestandenNog nietVerzamelen in één omgeving, eigenaar aanwijzen
Gescande documenten, papieren archiefNeeDigitaliseren met OCR, alleen wat je echt gebruikt
Kennis alleen in hoofden van medewerkersNeeVastleggen: laat AI juist hierbij helpen (interviews uitwerken)

Databewerking is structureel de grootste tijdpost in datawerk: in Anaconda’s State of Data Science-onderzoek (2020) ging 26 procent van de tijd naar het laden van data en 19 procent naar het opschonen ervan, samen bijna de helft. Hoe meer daarvan je vooraf zelf doet, hoe goedkoper het project. Hoe dat doorrekent in je totale budget lees je in wat AI-implementatie kost.

Wat moet eerst: de volgorde die werkt

Je hebt geen data-afdeling nodig, wel een volgorde:

  1. Kies één use-case. Bijvoorbeeld: klantvragen sneller beantwoorden. Dan weet je precies welke data ertoe doet (productdocumentatie, FAQ, retourbeleid) en kun je de rest negeren.
  2. Breng die data samen. Eén map of site, actuele versies, logische namen. Geen metadata-project, gewoon opruimen.
  3. Schoon gericht op. Verouderde documenten archiveren, gevoelige informatie eruit of afschermen, dubbelen verwijderen.
  4. Test met een kleine pilot. Laat de AI los op die ene dataset en kijk waar de antwoorden mis gaan. Elke fout wijst precies aan welk document ontbreekt of veroudert is.
  5. Leg het bij iemand neer. Eén eigenaar per kennisgebied die nieuwe documenten toevoegt en oude opruimt. Een uurtje per maand volstaat.

Wacht niet tot je data perfect is, dat moment komt nooit. Maak één proces AI-klaar, bewijs de waarde, en gebruik die winst om de volgende dataset aan te pakken.

Conclusie

Data readiness is voor het MKB geen technisch megaproject maar een kwestie van vijf vragen en gericht opruimen rond één use-case. Weet waar je data staat, zorg voor één actuele versie per document, bepaal vooraf wat de AI mag zien en wijs een eigenaar aan. Wie zo begint, heeft binnen weken een fundament waar elk volgend AI-initiatief op voortbouwt.

Hoe een traject daarna verloopt staat op de pagina over AI-implementatie.

AI-training voor directie en MT

Weten of jouw data klaar is voor AI?

In twee dagdelen met je directie of MT beoordelen we waar je data staat, kiezen we de use-case met het hoogste rendement en leggen we vast welke Proof of Concept je daarna laat bouwen op jouw eigen gegevens. €3.000 voor een hele dag, inclusief verslag en de AI Geletterdheid e-learning voor je hele organisatie.

Bekijk de training voor directie en MT →