Gestion de la qualité des données : pourquoi sans données fiables, l’IA échoue
63% des entreprises ne disposent pas (ou ne sont pas certaines de disposer) de processus et pratiques fiables de gestion des données spécifiques au développement de projets d’intelligence artificielle. Ce sont les résultats d’une enquête réalisée par Gartner auprès de plus d’un millier de responsables de la gestion des données, qui démontre comment même les organisations les plus matures, qui disposent de processus de gestion des données, négligent un aspect fondamental : la particularité du traitement des données pour la mise en œuvre de projets d’IA.
Les prévisions de Gartner sont très pessimistes : 60 % des projets d’IA seront abandonnés parce qu’ils ne s’appuient pas sur des données de qualité.
Pourquoi de nombreuses entreprises ne veillent pas à la qualité de leurs données (à tort)
Dans les projets d’analyse de données, de business intelligence et d’intelligence artificielle, les organisations moins matures et conscientes ont tendance à négliger un aspect fondamental : l’importance de la qualité des données sur lesquelles reposent la construction des systèmes d’intelligence, le développement d’applications ML et finalement l’utilité et la qualité elle-même des applications et des décisions prises sur la base de ces données.
Souvent, par souci de précipitation et d’objectifs d’économies, on demande de supprimer complètement les phases d’exploration et de nettoyage des données pour passer directement à ce que l’on croit être la véritable création de valeur, à savoir le développement d’applications ou la création de tableaux de bord et de reporting.
Il existe une corrélation inverse entre la connaissance réelle de ses données et leur qualité : moins elles sont connues, plus elles sont surestimées en termes d’exhaustivité, de qualité et de signification.
Un autre aspect peu compris est que les données sont l’un des facteurs de différenciation et de qualification de ces projets et parmi les facteurs avec lesquels construire un avantage concurrentiel. Dans la génération technologique actuelle, les modèles d’intelligence artificielle deviennent véritablement l’un des rares facteurs sur lesquels bâtir quelque chose de distinctif : les modèles LLM eux-mêmes sont accessibles sous la même forme à tous ; en pratique, de ce point de vue, leur utilisation constitue un point d’égalité, et certainement pas de différenciation.
Un concept fondamental doit être rappelé : tout projet d’intelligence artificielle, d’analyse ou d’automatisation doit reposer sur une hypothèse fondamentale, à savoir que les données sous-jacentes sont correctes, complètes et fiables. Si cette certitude fait défaut, le coût n’est pas seulement technique : un système décisionnel basé sur des données incomplètes et de mauvaise qualité génère de mauvais choix.
Pire encore avec les systèmes hautement automatisés : s’ils sont basés sur des données incorrectes, ils amplifient de manière incontrôlable leurs effets négatifs à grande échelle, parfois à l’insu des décideurs eux-mêmes.
Qu’est-ce que la qualité des données : une définition
Il existe différentes définitions de la qualité des données. L’une des plus partagées a été donnée par Danette McGilvray, selon laquelle la qualité des données est « la mesure dans laquelle l’information et les données peuvent constituer une source fiable pour toutes les utilisations requises ».
Le Dictionnaire Dama de la gestion des données indique, de manière moins directe, que la qualité des données est définie comme « dans le contexte d’une utilisation spécifique, la mesure dans laquelle l’information répond aux exigences et aux attentes de cette utilisation ».
La gestion de la qualité des données est un programme et non un projet
Il apparaît désormais clairement que l’absence de processus, de procédures et de compétences en matière de gestion de la qualité des données rend impossible non pas tant l’obtention de données de qualité que la connaissance du degré de qualité de ses données.
C’est précisément pour cette raison que la principale association internationale qui s’occupe de la gestion des données, à savoir DAMA International, consacre un chapitre entier de son corpus de connaissances de référence, le DAMA Data Management Body of Knolwedge (DMBOK), à la gestion de la qualité des données.
Selon le DMBOK, la gestion de la qualité des données consiste en « la planification, la mise en œuvre et le contrôle d’activités qui appliquent des techniques de gestion de la qualité aux données, pour garantir qu’elles sont adaptées à la consommation et répondent aux besoins de ceux qui les utilisent ».
Comme vous pouvez le constater, il s’agit d’une définition qui détourne l’attention d’un concept abstrait de correction vers un concept beaucoup plus pragmatique : la qualité existe en fonction de l’utilisation. Une adresse e-mail peut être parfaitement valable pour le marketing et totalement inadéquate pour une communication juridique qui nécessite une adresse légalement reconnue et traçable ; ou bien une estimation approximative des investissements d’un projet est parfaitement adaptée à une activité budgétaire, mais totalement incompatible avec les besoins fiscaux de suivi des investissements, des coûts et des revenus.
Comme le DMBOK lui-même nous le rappelle, la qualité des données est synonyme de qualité de l’information : des données de mauvaise qualité produisent inévitablement des informations inexactes et, par conséquent, de pires décisions commerciales.
Gestion de la qualité des données
Il est également nécessaire de dissiper un malentendu courant : comme mentionné ci-dessus, ne pas disposer d’un programme structuré de gestion de la qualité des données n’équivaut pas automatiquement à disposer de données de mauvaise qualité. Mais sans une gestion consciente, le niveau de qualité reste inconnu et le risque pour l’organisation augmente silencieusement, jusqu’à un point de rupture.
Tout d’abord, il convient de préciser que la gestion de la qualité des données n’est pas un projet conçu et mis en œuvre une fois pour toutes, mais un programme continu de gestion et de soins de la qualité des données, qui doit être planifié, mesuré et amélioré en permanence au fil du temps.
Le DMBOK encadre la gestion de la qualité des données comme un cycle continu qui reprend les principes du cycle de Deming, mais les adapte au contexte spécifique, définissant un cycle en 4 phases : Planifier-Déployer-Surveiller-Agir.
- Planifier : comprendre quels problèmes de données sont essentiels aux objectifs commerciaux, définir les exigences, les dimensions de qualité et les règles applicables.
- Déployer : effectuer le profilage des données, identifier les anomalies, remonter les causes originelles de mauvaise qualité et intervenir au plus près de la source des données.
- Surveiller : appliquer des contrôles statistiques continus, observer l’évolution des défauts et planifier des actions correctives.
- Agir : mettre en œuvre les remèdes identifiés et boucler la boucle.
Comme on peut le constater, il ne s’agit pas d’un projet avec une date de fin, mais d’un processus structurel qui nécessite un engagement continu et des responsabilités claires, attribuées à une équipe Data Quality avec l’implication de personnalités aux rôles spécifiques et formalisés, comme Propriétaire des donnéesje Gestionnaire de données, analystes de la qualité.
Des structures organisationnelles telles que la Conseil de surveillance de la qualité des données qui joue un rôle de surveillance. Enfin, des règles de qualité formalisées, des outils et des processus adéquats pour garantir en permanence le suivi et l’amélioration continue de la qualité des données sont fondamentaux.
Dimensions de la qualité des données
Si vous souhaitez garantir que les données sont de bonne qualité pour différentes applications, mesurer leur qualité devient essentiel. Une contribution importante offerte par le DMBOK est précisément la formalisation de 11 dimensions objectives de qualité, qui peuvent être détectées et évaluées rapidement. En se référant au corpus de connaissances DAMA pour plus de détails, les dimensions à prendre en compte sont rapportées ci-dessous :
- précision (exactitude);
- exhaustivité ;
- cohérence (cohérence);
- affaires courantes (monnaie);
- précision (précision);
- vie privée (confidentialité);
- caractère raisonnable (caractère raisonnable);
- intégrité référentielle ;
- opportunité;
- unicité (unicité);
- validité.
Une fois les dimensions de qualité définies, il est possible de déterminer les règles et seuils de qualité qui permettent de pondérer la qualité réelle des données disponibles, en pesant et en calibrant toujours cette évaluation par rapport à l’utilisation spécifique.
La notion de qualité
Il est important de souligner que des données de qualité sont obtenues grâce à un parcours et des actions qui nécessitent des investissements et des coûts opérationnels et économiques. Des efforts qui ont, en contrepartie, la confiance et l’assurance que l’on peut accorder aux données traitées de manière appropriée.
La notion de qualité est très large. Tout d’abord, une donnée doit être syntaxiquement correcte, c’est-à-dire représentée dans la bonne unité de mesure et dans la plage de valeurs possible. Dans ce cas, ce sont des données valides. Condition fondamentale, mais qui ne garantit pas une véritable utilité au niveau business. Des investissements supplémentaires sont nécessaires pour atteindre la validité sémantique, c’est-à-dire des données qui représentent correctement le phénomène qui l’a généré : c’est le passage de la validité à l’exactitude.
Mesure de la qualité : indicateurs de qualité des données (DQI)
Les règles de qualité ainsi définies doivent être mesurées à travers différents types de contrôles. Pour ce faire, il est nécessaire de définir des indicateurs de qualité mesurables de manière cohérente dans le temps. LE Indicateurs de qualité des données (DQI) pour être utiles et efficaces ils doivent posséder 6 caractéristiques, résumées par le sigle TARMAC, à savoir :
- T : traçabilité ;
- A : acceptabilité ;
- R : pertinence ;
- M : mesurabilité ;
- A : responsabilité/intendance ;
- C : contrôlabilité.
Correction d’erreur : nettoyage des données
Lorsque l’activité de contrôle détecte des erreurs, celles-ci doivent être corrigées.
Toutes les erreurs ne sont pas identiques, en termes de complexité, de pertinence et d’impact. Il est important de souligner que la correction des erreurs représente un coût et qu’il n’est pas réaliste de se fixer pour objectif d’atteindre zéro erreur. L’objectif global n’est même pas la minimisation des erreurs, mais plutôt la minimisation de la somme des coûts supportés par l’entreprise en raison des erreurs et du coût de correction des erreurs elles-mêmes. Autrement dit : même s’il est théoriquement possible d’obtenir une réduction supplémentaire des erreurs et avec cela une réduction supplémentaire du coût associé, si vous le faites au prix d’une augmentation des coûts globaux (coût d’erreur + coût de correction), vous commettez une erreur. Mieux vaut se « contenter » d’un résultat moins précis mais globalement moins coûteux.
Minimiser le coût de la correction des erreurs passe également par le recours à l’automatisation, qui réduit l’intervention humaine, par définition la plus coûteuse en matière de nettoyage des données. Pour cette raison, des procédures de correction automatisées sont adoptées dans tous les cas qui sont exempts d’ambiguïté et ne nécessitent pas de contrôle humain. Une approche manuelle, au contraire, est adoptée dans tous les cas les plus complexes et dans lesquels le coût et le risque associés à une éventuelle correction incorrecte sont très élevés.
Il existe, entre les deux, des cas où les erreurs sont détectées et corrigées automatiquement, mais la valeur modifiée nécessite l’approbation humaine. En pratique, l’application d’une sorte d’humain dans la boucle.
Outils et techniques au service du Data Quality Management
Pour garantir la qualité des données, les organisations mènent une série d’activités, telles que : le profilage des données, la normalisation, la transformation, la résolution d’identité, l’enrichissement, etc.
Les glossaires de données, les tableaux de bord de suivi, les outils d’analyse statistique et de visualisation en général sont également très utiles.
Parmi toutes les techniques, l’une des plus pertinentes est l’analyse des causes profondes (RCA). Son importance réside dans son objectif : en recherchant l’origine avant l’erreur, il permet non seulement de corriger l’erreur dans un cas isolé, mais aussi de l’éliminer dans les utilisations futures.
Conclusions
Comme nous l’avons vu et démontré, la qualité des données est fondamentale. Mais avant tout, il est essentiel de connaître la qualité de vos données. Cela n’est possible que si des procédures de Data Quality Management ont été adoptées et, en parallèle, des compétences et des structures organisationnelles et de gouvernance ont été construites, mettant à disposition des groupes de travail et des figures professionnelles codifiées et reconnues des outils, des technologies et des supports organisationnels.
Références bibliographiques
