Mede georganiseerd door Artefact en dbt Labs, het webinar “Data Quality by Design: Oorzaken aanpakken, niet symptomen” had tot doel een cruciale strategische afstemming aan te pakken die binnen ondernemingen nog steeds onvoldoende wordt benut: de convergentie van Data-governance en Data Engineering.
Florence Bénézit, partner en hoofd wereldwijde productie bij Artefact, en Eric Ortiz, Partner Development Manager EMEA bij dbt Labs, presenteerde een uitgebreid methodologisch kader voor het direct integreren van data-kwaliteit in de architectuur- en ontwerpfasen van data-producten — een fundamentele aanpak voor het realiseren van een meetbaar rendement op de investering op de lange termijn.
Waarom reactief kwaliteitsbeheer mislukt
In de meeste bedrijfsomgevingen wordt de kwaliteit van data reactief aangepakt: fouten worden pas verderop in het proces, tijdens het gebruik – bijvoorbeeld in dashboards of BI-oplossingen voor het management (reports) – opgemerkt en worden per geval aan het einde van de pijplijn verholpen.
Deze aanpak kent drie belangrijke nadelen:
- Aanzienlijke operationele overheadkosten: Data-teams besteden het grootste deel van hun tijd aan correctief onderhoud en handmatige data-afstemming.
- Aantasting van het vertrouwen in het bedrijfsleven: Tegenstrijdige of onvolledige data-gegevens belemmeren de invoering van analytische systemen en de besluitvorming op leidinggevend niveau.
- Een belemmering voor schaalbaarheid: De opeenstapeling van ad-hoc-hotfixes maakt de pijplijnen ingewikkelder en vergroot de technische schuld.
De kwaliteit van Data mag niet worden beperkt tot een achteraf uitgevoerde opschoning of worden beschouwd als een louter op documentatie gebaseerde exercitie binnen een data-catalogus. Om effectief te zijn, moet kwaliteit “vanaf het ontwerp” worden ingebouwd en geïmplementeerd binnen de codebase en de architectuur, en zich uitstrekken van de invoer tot het gebruik.
Het stappenplan in zes stappen: van bron tot consument
Om de onderliggende oorzaken in plaats van de symptomen aan te pakken, organiseert Artefact het kwaliteitsbeheer over zes schakels van de data-waardeketen:
- Kwaliteit van de bron (A)
Het is van het grootste belang om in te grijpen bij de bron systemen stroomopwaarts: het verfijnen van de bedrijfsprocessen voor gegevensinvoer, het aanpassen van de bedrijfsarchitectuur en het afdwingen van strikte invoerformaten binnen IT-toepassingen. - Bronbewaking (B)
Het implementeren van geautomatiseerde controles op het ruwe data-niveau om afwijkingen bij het invoeren te detecteren en onmiddellijke herstelworkflows in gang te zetten. - Data Productontwerp (C)
Het vastleggen van strikte data-overeenkomsten tussen de bedrijfs- en engineeringteams vóór aanvang van de ontwikkeling. In deze overeenkomsten worden de schemaspecificaties, de bedrijfssemantiek en de aanvaardbare data-kwaliteitsdrempels vastgelegd. - Codekwaliteit via dbt (D)
Het op schaal uitvoeren van unit- en integratietests in transformatiepijplijnen met behulp van dbt. Dankzij geautomatiseerde CI/CD-controles (dbt build) wordt code die niet aan de vereisten voldoet, geblokkeerd voordat deze in de productieomgeving wordt geïmplementeerd. - Operationele monitoring (E)
Voortdurende monitoring van de prestaties tijdens de uitvoering: het bijhouden van de actualiteit van data, uitvoeringsvertragingen en pieken in het datavolume om storingen in de dienstverlening te voorkomen. - Observabiliteit in de benedenstroomse fase (F)
Het rechtstreeks weergeven van data-gezondheidsstatistieken in BI- en rapportagetools (bijvoorbeeld Tableau, Sigma) om eindgebruikers in realtime te waarschuwen wanneer er problemen worden gedetecteerd.
Bedrijfsleven en techniek: een overzicht van de 8 dimensies van Data-kwaliteit
Een Data Quality by Design-initiatief moet tegelijkertijd rekening houden met zowel de zakelijke vereisten als de technische beperkingen:
Zakelijke dimensies (de 3 C’s + nauwkeurigheid):
- Volledigheid: Er zijn geen ongerechtvaardigde ontbrekende waarden.
- Conformiteit: Naleving van gestandaardiseerde formaten en bedrijfsregels.
- Consistentie: Logische samenhang tussen tabellen en kolommen.
- Nauwkeurigheid: Nauwkeurige afstemming op de werkelijke situatie ter plaatse.
Technische afmetingen:
- Uniekheid: Er zijn geen dubbele primaire sleutels.
- Tijdigheid: De beschikbaarheid van Data is in overeenstemming met de vastgestelde SLA’s.
- Versheid: Een verversingsritme van data, afgestemd op de operationele behoeften.
- Integriteit: Verliesvrije behoud van data in de verwerkings- en overdrachtsprocessen.
De waardepropositie van het dbt Labs-platform
Door gebruik te maken van dbt worden deze theoretische aspecten omgezet in uitvoerbare codespecificaties. Controles worden vastgelegd in voor mensen leesbare YAML-configuratiebestanden, beheerd via Git en automatisch uitgevoerd bij elke modelupdate.
Door de data-traceerbaarheid, de data-contracten en de door agentische AI aangestuurde assistenten (zoals dbt Wizard) van dbt te combineren, kunnen engineeringteams binnen enkele minuten de onderliggende oorzaak van een afwijking opsporen, terwijl de volledige end-to-end-traceerbaarheid van de transformatie behouden blijft.
De cruciale invloed op agentieke AI
De opkomst van autonome AI-agenten leidt tot een fundamentele toename van het risicoprofiel dat gepaard gaat met een gebrekkige data-kwaliteit. In tegenstelling tot traditionele dashboards die zijn ontworpen om menselijke besluitvorming te ondersteunen, AI-agenten operationele workflows rechtstreeks uitvoeren binnen de kernsystemen van de onderneming (bijvoorbeeld ERP- en CRM-systemen).
In dit scenario leidt een foutieve data niet langer alleen tot onjuiste rapportages, maar veroorzaakt deze ook foutieve geautomatiseerde transacties. Een bescheiden Het foutenpercentage van 1% bij 10.000 dagelijkse transacties bedraagt 100 foutieve geautomatiseerde bewerkingen per dag. Autonome AI vereist daarom compromisloze normen op het gebied van data-kwaliteit, lage latentie en semantische nauwkeurigheid.
Actieplan voor Data-leiders
Om de overstap te maken van een reactieve aanpak naar een Data Quality by Design-raamwerk, dienen data-leiders prioriteit te geven aan de volgende operationele speerpunten:
- Geef prioriteit aan strategische gebruiksscenario’s: Sluit data-contracten af voor data-producten met een grote impact op de bedrijfsvoering, in plaats van te proberen het gehele data-assetsbestand van de onderneming in één keer grondig te herzien.
- Het automatiseren van testen in de ontwikkelingscyclus: Integreer schemavalidatie en detectie van afwijkingen rechtstreeks in dbt-pijplijnen binnen de CI/CD-workflow.
- Afwijkingen bij de bron verhelpen: Maak gebruik van inzichten op het gebied van observability om de upstream-invoerlogica en de IT-processen binnen de onderneming te optimaliseren, en zo duurzame kwaliteitsverbeteringen op de lange termijn te realiseren.
Bekijk het webinar op YouTube (Frans)

BLOG





