Organisé conjointement par Artefact et dbt Labs, ce webinaire sur le thème «Data quality by design : traiter les causes, pas les symptômes» avait pour objectif d'adresser un alignement stratégique encore peu appliqué dans les organisations : la convergence entre la Data Governance et le Data Engineering.
Florence Bénézit, Partner & Global Manufacturing Lead chez Artefact Eric Ortiz, Partner Development Manager EMEA chez dbt Labs, ont présenté un cadre méthodologique complet pour intégrer la qualité des données dès la phase d'architecture et de conception des data products, une approche fondamentale pour délivrer un ROI mesurable et pérenne.
Pourquoi la gestion réactive de la qualité ne fonctionne pas
Dans la majorité des entreprises, la qualité des données est traitée de manière réactive : les erreurs sont détectées lors de l’utilisation des données (dans les dashboards ou les rapports décisionnels) et corrigées au cas par cas en bout de chaîne.
Cette méthode a trois inconvénients principaux :
- Un surcoût opérationnel majeur: Les équipes Data consacrent la majorité de leur temps à la maintenance corrective et à la réconciliation manuelle des chiffres.
- Une perte de confiance des métiers: Des données contradictoires ou incomplètes freinent l'adoption des outils analytiques et la prise de décision.
- Un frein à l'échelonnement (scale): L'accumulation de correctifs ponctuels complexifie les pipelines et augmente la dette technique.
La qualité des données ne peut pas se limiter à un nettoyage a posteriori ou à une démarche purement documentaire dans un catalogue. Pour être efficace, elle doit être conçue et exécutée « by design » dans le code et l'architecture, de la source jusqu'au point de consommation.
La feuille de route en 6 étapes : De la source au consommateur
Pour traiter les causes profondes des défaillances et non leurs symptômes, Artefact structure la gestion de la qualité le long des 6 maillons de la chaîne de valeur :
- La qualité à la source (A)
L'action prioritaire consiste à intervenir sur les systèmes émetteurs : corriger les processus de saisie métier, adapter l'architecture d'entreprise et verrouiller les formats d'entrée dans les applications IT. - Le monitoring des sources (B)
Mise en place de contrôles automatisés sur la couche de données brutes (Raw Data) pour détecter les anomalies dès leur création et déclencher immédiatement les processus de remédiation. - Le design du Data Product (C)
Formalisation de data contracts stricts entre les équipes métier et techniques avant tout développement. Ces contrats définissent les schémas, la sémantique et les seuils d'acceptabilité de la donnée. - La qualité du code grâce à dbt (D)
Industrialisation des tests unitaires et d'intégration dans les pipelines de transformation via dbt. Grâce aux commandes automatisées dans la CI/CD (dbt build), tout code non conforme est bloqué avant son passage en production. - La surveillance en Run (E)
Contrôle continu des opérations techniques : suivi de la fraîcheur (freshness), des temps d'exécution et des volumes pour prévenir les ruptures de service. - L'observabilité côté consommateur (F)
Diffusion de l'état de santé des données directement dans les outils de restitution (Tableau, Sigma, etc.) pour alerter les utilisateurs finaux en cas d'incidents identifiés.
Métier et technique : couvrir les 8 dimensions de la data quality
Une démarche Data Quality by Design doit adresser simultanément les exigences métier et les contraintes de l'ingénierie :
Dimensions métier (Les 3C + Accuracy) :
- Complétude (Completeness): Absence de données manquantes non justifiées.
- Conformité (Conformity): Respect des standards de formats et de règles métier.
- Cohérence (Consistency): Logique inter-tables et inter-colonnes.
- Exactitude (Accuracy): Alignement strict avec la réalité du terrain.
Dimensions techniques :
- Unicité (Uniqueness): Absence de doublons sur les clés primaires.
- Ponctualité (Timeliness): Disponibilité de la donnée aux échéances prévues.
- Fraîcheur (Freshness): Fréquence de rafraîchissement adaptée aux besoins opérationnels.
- Intégrité (Integrity): Conservation des données sans perte lors des flux de transfert.
L'apport de la plateforme dbt Labs
L'utilisation de dbt permet de transformer ces dimensions théoriques en spécifications exécutables dans le code. Les contrôles sont déclarés dans des fichiers YAML(un langage de données lisible par l'humain, principalement utilisé pour rédiger des fichiers de configuration), versionnés sous Git et exécutés automatiquement à chaque mise à jour du modèle.
En combinant le lineage de dbt, les data contracts et les assistants basés sur l'IA agentique (dbt Wizard), les équipes techniques identifient l'origine exacte d'une anomalie en quelques minutes tout en garantissant la traçabilité complète des transformations.
L'impact critique sur l'IA Agentique
L'émergence des agents IA autonomes modifie l'échelle de risque liée à la qualité des données. Contrairement aux tableaux de bord traditionnels qui servent de support à des décisions humaines, les agents IA exécutent directement des actions métier dans les systèmes d'information (ERP, CRM).
Dans ce contexte, une donnée erronée n'entraîne plus seulement une mauvaise analyse, mais déclenche des opérations automatisées incorrectes. Un taux d'erreur de 1 % sur un volume de 10 000 transactions quotidiennes génère 100 actions erronées par jour. L'IA autonome exige donc des normes de qualité, de mise à jour et de précision sémantique rigoureuses.
Plan d'action pour les décideurs Data
Pour passer d'une posture réactive à un cadre Data Quality by Design, les priorités opérationnelles sont :
- Prioriser les cas d'usage stratégiques: Définir des data contracts sur les data products à fort impact business plutôt que de tenter de couvrir l'intégralité du patrimoine applicatif d'un coup.
- Automatiser les tests dans le cycle de développement: Intégrer la validation des schémas et la détection d'anomalies directement dans les pipelines dbt au niveau de la CI/CD.
- Traiter les anomalies à la source: Exploiter les remontées d'observabilité pour corriger les règles de saisie et les flux IT amont, garantissant ainsi une amélioration durable de la qualité.
Regardez le webinaire sur YouTube

BLOG





