Data kwaliteit: het fundament voor betrouwbare AI.
Zonder goede data geen goede AI. Dit klinkt simpel, maar in de praktijk sneuvelen de meeste AI-projecten in het MKB niet op techniek of budget, maar op rommelige, inconsistente en onvolledige data. Data kwaliteit is de eerste en belangrijkste investering voor iedereen die AI serieus wil inzetten.
Prometheus21 begeleidt MKB-organisaties bij het maken van hun data AI-ready. Via de zes klassieke dimensies, objectieve metingen en use-case-gedreven verbetering. Onderdeel van onze data kwaliteit pillar, gekoppeld aan concrete AI-implementaties.
Data kwaliteit is geschiktheid voor doel. Niet perfectie, wel vertrouwen.
Data kwaliteit is de mate waarin data geschikt is voor het doel waarvoor je het wilt gebruiken. Dat klinkt abstract, maar is wezenlijk: data die goed genoeg is voor een maandelijkse omzetrapportage kan volstrekt ongeschikt zijn om een AI-model te trainen. De standaarddefinitie werkt met zes dimensies: accuracy (klopt de waarde), completeness (is alles gevuld), consistency (matcht het tussen systemen), timeliness (is het actueel), validity (voldoet het aan het format) en uniqueness (geen dubbele records). Een nuttige kwaliteitsscore kijkt naar meerdere dimensies tegelijk, niet naar een enkel getal dat alles samenvat.
Waarom dit er voor AI extra toe doet? AI leert patronen uit data. Bij een klassiek rapport is een fout in de data een afwijking die je ziet. Bij AI verdwijnt diezelfde fout in het model en komt hij terug als een zelfverzekerd antwoord. Garbage in, garbage out is geen cliche, het is een wet. Een chatbot die op een verouderde kennisbank is getraind, geeft verouderd advies zonder aarzeling. Een leadscoring-model getraind op inconsistente historische data scoort nieuwe leads verkeerd, en niemand ziet het tot een slechte deal is geslopen. Dit principe maakt data kwaliteit voor AI een hardere eis dan voor traditionele BI.
Dit betekent niet dat alle data perfect moet zijn voordat je kunt starten. Dat is de grootste vergissing die we tegenkomen: een MKB-directie die een jaar lang wacht op een data-lake-project voordat ze aan AI beginnen. De realistische aanpak is use-case-gedreven: kies een eerste AI use case, identificeer de bronnen waar die van afhankelijk is, verbeter alleen die bronnen tot het niveau dat de use case eist. Niet alles tegelijk, niet alle bronnen. Dit sluit aan bij onze bredere AI strategie-aanpak, waarin data-werk en use-case-uitvoering hand in hand gaan.
De zes dimensies zijn niet abstract, je kunt ze meten. Data kwaliteit meten doe je met concrete queries en tests: completeness is het percentage null-waarden in een veld, validity is het percentage records dat voldoet aan een format-regel, uniqueness is het aantal duplicaten op natuurlijke sleutels. Voor MKB zijn gratis tools zoals Great Expectations (Python) of een paar SQL-dashboards ruim voldoende; enterprise-platforms kosten tienduizenden euro's per jaar zonder extra waarde voor organisaties onder de honderd medewerkers. Begin met meten, niet met tools kopen.
Wat ons onderscheidt: wij benaderen data kwaliteit vanuit de AI use case, niet vanuit een generiek framework. Je meet de bronnen die je eerste AI-gebruik raken, je verbetert tot het niveau dat je use case vereist, en je bouwt monitoring zodat kwaliteit niet langzaam terugzakt. Deze pragmatische route levert binnen weken bruikbare data op, in plaats van maanden wachten op een theoretisch perfect datalandschap. Voor bedrijven die ook met documenten en kennisbronnen werken, is de volgende stap een RAG-systeem opzetten, dat alleen werkt als de brondocumenten op orde zijn.
Data quality definitie: Data quality is the degree to which data is fit for its intended purpose. In de praktijk wordt dit geoperationaliseerd via zes dimensies: accuracy, completeness, consistency, timeliness, validity en uniqueness.
Data kwaliteit AI: Voor AI-toepassingen telt kwaliteit zwaarder omdat modellen fouten leren in plaats van zichtbaar te laten. Minimum-eisen varieren per use case, maar liggen typisch 10-20 procent hoger dan voor BI-rapportage.
De zes dimensies uitgelegd
Elke dimensie heeft een eigen meetmethode en een eigen type probleem. Samen dekken ze verreweg de meeste data-issues die we tegenkomen bij MKB-AI-projecten.
Accuracy en validity
Accuracy is de mate waarin een waarde overeenkomt met de werkelijkheid. Een debiteurenstand van 12.400 euro in het CRM moet overeenkomen met de werkelijke openstaande post in de boekhouding. Accuracy meet je door steekproeven te vergelijken tegen een bron van waarheid. Validity is aanverwant: voldoet de waarde aan het vereiste format? Een postcode heeft vier cijfers en twee letters, een e-mail heeft een @-teken. Validity meet je met regex of veldvalidaties. Samen vangen deze twee ongeveer 30 procent van alle datakwaliteitsproblemen af. Implementeer picklists en validaties aan de bron om nieuwe problemen te voorkomen.
- Werkelijkheid versus registratie
- Format-validatie aan de bron
- Picklists in plaats van vrije tekst
- Steekproeven tegen bron van waarheid
Completeness en uniqueness
Completeness is het percentage records waarin een kritisch veld is gevuld. Voor klantgegevens verwacht je dat naam, e-mail en telefoonnummer 99 procent plus ingevuld zijn. Voor aanvullende velden (branche, bedrijfsgrootte) is 70 procent al acceptabel. Uniqueness gaat over duplicaten: komt dezelfde entiteit meerdere keren voor onder net andere spelling? Dubbele klantrecords zijn een klassieker in MKB-CRM's. Uniqueness meet je met group-by op natuurlijke sleutels (naam plus postcode, of e-mailadres). Beide dimensies verbeter je met een eenmalige schoonmaak plus validaties om herhaling te voorkomen.
- Null-percentage per kritisch veld
- Duplicate-detection op natuurlijke sleutels
- Verplichte velden in invoerformulieren
- Eenmalige ontdubbeling als start
Consistency tussen systemen
Consistency is of dezelfde data in verschillende systemen overeenkomt. Een klant die in CRM 'Bakker BV' heet en in de boekhouding 'Bakker B.V.' heet, is technisch hetzelfde maar levert veel problemen op voor AI-modellen die data uit beide bronnen combineren. Consistency meet je door velden tussen systemen te kruisen en afwijkingen te rapporteren. Voor MKB is dit vaak de grootste uitdaging omdat CRM, boekhouding, projectmanagement en e-commerce zelden een gedeelde klantidentificatie gebruiken. Oplossingen: een master-data-laag met unieke klant-ID, of een mapping-tabel die synoniemen verbindt. Voor AI-use-cases die data uit meerdere bronnen combineren, is dit vaak voorwaarde.
- Cross-system matching
- Master-data-laag of mapping-tabel
- Unieke klant-ID over systemen
- Cruciaal voor multi-source AI
Timeliness en actualiteit
Timeliness is hoe actueel je data is. Dit is relatief aan het doel: voor fraudedetectie moet data seconden-actueel zijn, voor jaaranalyse volstaat maandelijks. Voor de meeste MKB-AI-use-cases ligt de lat op dagelijks of wekelijks. Timeliness meet je met timestamps: wanneer is een record voor het laatst bijgewerkt, hoe oud is de oudste kritieke waarde. Verouderde data in een kennisbank is misschien wel het grootste probleem voor RAG-chatbots in het MKB. Een contract dat drie jaar oud is, een beleidsdocument dat niet meer geldt, een productprijs uit een oude catalogus: de AI weet het verschil niet en geeft ze als huidige feiten terug. Timeliness-monitoring is daarom een must voor elke AI-use-case met documentbronnen.
- Timestamps bij elke wijziging
- Actualiteits-drempels per bron
- Archivering van verouderde documenten
- Cruciaal voor RAG-chatbots
Samen: zes dimensies, een gebalanceerde score
In de praktijk scoor je per bron op alle zes dimensies en kijk je naar de balans. Een CRM kan prima completeness scoren (95 procent) maar laag op consistency met de boekhouding (60 procent). Een documentarchief kan hoog accuracy scoren (alles klopt nog) maar laag timeliness (helft is verouderd). Door alle zes dimensies apart te meten, zie je welke interventies de meeste impact hebben. Een gemiddeld-cijfer-over-alles zegt weinig; de onderliggende verdeling wel. Deze dimensies kun je ook koppelen aan concrete use cases: een factuurverwerkings-AI vraagt hoge accuracy en validity op factuurregels, een chatbot vraagt hoge timeliness op documentbronnen, een leadscoring-model vraagt hoge consistency tussen CRM en website-gedrag. De zes dimensies zijn het universele raamwerk, use cases bepalen welke je het eerst aanpakt. Voor bredere context zie onze data audit-gids met het volledige stappenplan.
- Per dimensie objectieve meting
- Balans boven gemiddelde
- Use case bepaalt prioriteit
- Gekoppeld aan concrete AI
Drie routes om data kwaliteit te meten
Afhankelijk van je technische volwassenheid kies je een andere route. Voor MKB werken we meestal met optie een of twee; optie drie is voor organisaties die al dataplatforms hebben.
Handmatige queries in BI
De eenvoudigste route: schrijf een handvol SQL-queries die per dimensie een score berekenen, toon ze in een BI-dashboard (Metabase, Superset, Power BI). Niet ideaal voor schaal, maar voor een MKB met twee tot vijf kritische bronnen ruim voldoende. Opzet duurt een dag tot een week per bron, kosten beperkt tot BI-licentie die je vaak al hebt. Ideaal als eerste stap om zichtbaar te maken welke problemen er zijn, nog voordat je investeert in specialistische tooling.
Gratis open-source tool
Great Expectations is een Python-library voor data-kwaliteit-tests. Je definieert verwachtingen per veld (bijvoorbeeld: postcode is geldig, leeftijd tussen 0 en 120, e-mail is uniek), de tool draait de tests en rapporteert resultaten. Gratis, actief onderhouden, met groeiende community. Ideaal voor MKB dat Python-capaciteit heeft of via een partner gebruikt. Alternatief: Soda Core, met vergelijkbare functionaliteit en SQL-first syntax. Beide tools integreren met populaire warehouses (BigQuery, Snowflake) en schedulers (Airflow, Prefect). Implementatie in weken, geen licentiekosten.
Monte Carlo, Anomalo, Bigeye
Voor organisaties met complexe datalandschappen (vanaf ongeveer 100 medewerkers en tientallen databronnen) zijn enterprise-platforms passend. Monte Carlo, Anomalo en Bigeye bieden automatische anomaliedetectie met machine learning, observability-dashboards en integraties met data-stacks. Kosten: 25.000-100.000 euro per jaar. Voor 90 procent van MKB is dit overkill. Pas overwegen als route 1-2 structureel tekortschiet door schaal of complexiteit, niet omdat enterprise-tools 'professioneler' zouden zijn.
Zo pakken wij data kwaliteit aan
Vier stappen van inventarisatie tot continue monitoring, gekoppeld aan de AI-use-cases waar je mee werkt.
Inventariseer en eigenaar
Maak een kaart van alle relevante bronnen (CRM, ERP, boekhouding, documenten, e-mail). Wijs per bron een menselijke eigenaar toe. Geen bron zonder verantwoordelijke.
Meet de zes dimensies
Per kritieke bron profiling op accuracy, completeness, consistency, timeliness, validity en uniqueness. Objectieve scores, geen meningen, rapport met concrete issues.
Use-case-gedreven schoonmaken
Verbeter alleen de bronnen die je eerste AI-use-cases raken. Eenmalige opschoning plus validaties aan de invoerkant om herhaling te voorkomen.
Monitoring en governance
Dashboards die dagelijks of wekelijks kernscores tonen, alerts als drempels zakken. Lichte governance: maandelijks data-overleg met eigenaren, voorkomt terugval.
Onze belofte: Binnen vier tot acht weken per kritieke bron breng je kwaliteit op het niveau dat je AI-use-cases vragen. Gekoppeld aan onze data schoonmaken 7-stappen methode en data governance-raamwerk voor continuiteit.
Drie MKB-trajecten, drie data-problemen opgelost
Hoe data kwaliteit-verbetering er in de praktijk uitziet bij drie verschillende MKB-profielen.
CRM-opschoning brengt leadscoring van 40 naar 82 procent accuracy
De situatie: Een groothandel wilde AI-gestuurde leadscoring inzetten maar de eerste resultaten waren slechter dan handmatige scoring door sales. Onderzoek liet zien: 28 procent dubbele klantrecords, 45 procent ontbrekende branche-data, wisselende schrijfwijzen voor dezelfde klanten.
Aanpak: Zes weken gerichte CRM-opschoning. Week 1-2 profiling en rapportage. Week 3-4 ontdubbeling via fuzzy-matching en branche-verrijking via KvK-API. Week 5-6 validaties inbouwen (picklists, verplichte velden) plus een maandelijks dashboard. Geen nieuw systeem, wel schone data in bestaand CRM.
Resultaat: Leadscoring-accuracy steeg van 40 naar 82 procent. Sales kreeg vijf tot zeven goed-gescoorde leads per dag in plaats van een lange gemengde lijst. Omzet per maand steeg met 14 procent in het eerste kwartaal na de opschoning. Investering: 18.000 euro. Terugverdientijd: minder dan drie maanden. De koppeling met hun bredere AI automatisering-traject werd vervolgens veel productiever.
“We dachten dat de AI slecht was. Bleek dat onze data slecht was, zes weken opruimen en alles werkt.”
- Sales director, groothandel (geanonimiseerd)
Kennisbank-opschoning redt RAG-chatbot van uitschakelen
De situatie: Een zakelijke dienstverlener had een RAG-chatbot gebouwd op 2.400 interne documenten. Medewerkers klaagden over tegenstrijdige of verouderde antwoorden. De bot stond op het punt te worden uitgezet omdat het vertrouwen wegzakte.
Aanpak: Data-audit van de documentbron via timeliness- en consistency-check. Resultaat: 680 documenten waren ouder dan drie jaar, 120 bevatten tegenstrijdige informatie met recentere versies, 90 waren interne concepten die nooit geautoriseerd waren. Archivering van alle verouderde documenten, eigenaar aangewezen per documentcategorie, versie-controle ingeregeld.
Resultaat: Gebruikerstevredenheid chatbot steeg van 3.4 naar 4.6 op 5. Dagelijks gebruik verdubbelde binnen zes weken. Medewerkers vertrouwden de antwoorden weer. De bot werd behouden en uitgebreid. Investering: 22.000 euro (inclusief opzet governance). Terugverdienen: binnen vier maanden door bespaarde supportvragen. Aanpak past naadloos bij onze RAG-systeem-gids.
“Het probleem was niet de AI, het waren 680 verouderde documenten die we tien jaar hadden laten liggen.”
- CIO, dienstverlener (geanonimiseerd)
Master-data-laag lost consistency-probleem op voor voorraadvoorspelling
De situatie: Een productiebedrijf wilde AI gebruiken voor voorraadvoorspelling. Data kwam uit ERP (Exact), CRM (HubSpot) en e-commerce (WooCommerce). Dezelfde producten hadden per systeem andere SKU's en omschrijvingen. Handmatig matchen kostte een fulltime rol.
Aanpak: Eight-weken project. Master-product-tabel opgezet met unieke interne product-ID. Mapping-tabel die ERP-SKU, CRM-productnaam en WooCommerce-slug koppelt aan interne ID. Wekelijkse sync-monitoring via dashboard. Consistency-score steeg van 52 procent (match rate tussen systemen) naar 97 procent binnen twee maanden.
Resultaat: Voorraadvoorspelling werd werkbaar. Voorraadkosten daalden met 18 procent door beter ingekochte volumes. Nee-verkoop daalde met 24 procent, handmatig matching-werk (FTE) kon worden afgebouwd. Investering: 45.000 euro, jaarbesparing: ruim 180.000 euro. Onderdeel van hun bredere AI strategie-traject, waarin voorraadvoorspelling het tweede pilotproject was.
“Een master-data-laag klonk als overhead. Bleek de enige manier om AI uberhaupt te laten werken over onze systemen heen.”
- COO, productiebedrijf (geanonimiseerd)
Wil je weten waar jouw data staat?
Plan een gratis kennismaking om je kritieke bronnen door te lopen en een data-assessment te plannen.
Vier valkuilen bij data kwaliteit in het MKB
De klassieke fouten die data-verbetertrajecten laten ontsporen, en hoe je ze voorkomt.
Alles-in-een-keer-perfect
Het klassieke data-lake-project: een jaar lang alle bronnen op niveau brengen voordat er iets met AI gebeurt. Dit eindigt bijna altijd zonder werkende AI en met uitputting aan beide kanten. De tegenpartij: begin met je eerste use case, verbeter alleen de bronnen die hij raakt, lever werkende AI op in weken, bouw daarna op. Dit tempo past ook bij hoe directies investeringsbeslissingen willen nemen: zien werkt, wachten niet.
Tools kopen zonder meten
Bedrijven kopen een data-kwaliteit-platform voor 40.000 euro per jaar zonder eerst te hebben gemeten wat er speelt. Tools lossen geen problemen op die niet zijn gedefinieerd. Start met SQL-queries en Great Expectations, meet de zes dimensies, krijg zicht op welke problemen bestaan. Investeer pas in duurdere tooling als gratis tools structureel tekortschieten, niet omdat enterprise-platforms 'professioneler' klinken. Deze volgorde bespaart veel geld en levert sneller waarde op.
Geen eigenaar per bron
Opgeschoonde data zakt binnen zes maanden terug naar de oude kwaliteit als er geen eigenaar is. Formeel: per bron wijs je een data-eigenaar toe (meestal de afdelingshoofd die de bron het meest gebruikt). Verantwoordelijkheden: controleert kwaliteitsdashboard, escaleert bij terugval, keurt wijzigingen aan schema goed. Zonder dit rolmodel eindig je over een jaar met dezelfde opschoningsvraag als waarmee je begon. Zie ook onze data governance-gids.
Data-teams zonder AI-kennis
Een data-team dat geen AI-ervaring heeft, meet wat BI-belangrijk is maar niet wat AI-belangrijk is. Voor BI is accuracy vaak leidend, voor RAG-chatbots is timeliness meer bepalend. Voor ML-training is completeness cruciaal, voor anomaliedetectie juist uniqueness. Betrek je AI-partner bij het opstellen van kwaliteitseisen per use case. Dit voorkomt dat je maanden verbetert aan de verkeerde dimensie. Dit is de reden waarom wij data-werk en AI-werk samen aanbieden, niet in silo's.
ROI van data kwaliteit verbeteren
Wat levert een gerichte data-kwaliteit-verbetering op, vergeleken met doorgaan zonder:
Investering per bron
Assessment plus opschoning: 15.000-30.000 euro
Monitoring-setup: 5.000-10.000 euro
Interne tijd eigenaar: 2-4 uur per week doorlopend
Opbrengst
AI-use-cases gaan werken: voorwaarde voor ROI
Minder fouten in rapportage: typisch 10-20% betere beslissingen
Mensuren op opschoning: 20-40% minder structureel
Terugverdientijd per bron typisch drie tot zes maanden, met name door AI-use-cases die anders niet werken.
Veelgestelde vragen over data kwaliteit
Tien vragen die MKB-directies ons het vaakst stellen over data kwaliteit, meten en verbeteren voor AI.
Stel je vraagData kwaliteit als fundament voor AI
In een gratis kennismaking bespreken we welke bronnen jouw eerste AI-use-cases raken en hoe we data-readiness in weken opbouwen, niet in jaren.