Pour rester dans cette métaphore de la construction, si des problèmes de cette nature existent, ceux-ci seront cachés et peu visibles dans l’édifice final. Il est donc nécessaire d’apporter un soin particulier lors des étapes de collecte, de traitement, de nettoyage des données. Ce n’est pas pour rien que l’on estime que 80% du temps passé sur un projet de data science est consommé sur ce type de tâches.
Afin d’éviter de tomber dans ce piège et de limiter la charge nécessaire à la réalisation de ces opérations qui peuvent être fastidieuses, il faut accepter trois principes fondamentaux :
Accepter ces principes n’enlève pas l’obligation de passer par ce travail préalable à toute analyse mais, bonne nouvelle : savoir identifier ces risques et apprendre au fur et à mesure de nos projets, permet de limiter la portée de ce deuxième obstacle.
Les données sont sales. Je dirais même plus, toutes les données sont sales (voir premier principe énoncé précédemment), problématique de formatage, de saisie, d’unités incohérentes, de valeurs NULL etc.
Quelques exemples de ce piège sont très connus
Nous pouvons citer le crash de la sonde Mars Climate Orbiter de la NASA en 1999, par exemple. Une erreur à 125 millions de dollars qui a été causée par un double système d’unité : unités impériales et unités issues du système métriques. Cela a occasionné un calcul erroné qui a joué sur la puissance envoyée aux propulseurs de la sonde et à la destruction de celle-ci.
Heureusement, toutes les erreurs de cette nature ne vont pas nous coûter autant d’argent ! Mais elles auront malgré tout des impacts significatifs sur les résultats et le ROI des analyses que nous sommes amenés à mener.
Ainsi, chez DATANALYSIS, nous menons actuellement plusieurs projets spécifiquement sur la qualité de données dans le cadre de sujet de DATA Marketing et nous faisons face à deux types de sujet :
-Normalisant les champs (numéro de téléphone, email etc.) : +262 692 00 11 22 / 00262692001122 / 06-92-00-11-22 correspondent à la même ligne et nous pouvons grâce à des traitements adaptés automatiser une grande partie de ce travail ;
– Complétant des champs vides grâce aux autres données présentes dans la table. Nous pouvons par exemple déduire le pays de résidence à partir des indicatifs téléphoniques, des codes postaux, des villes etc.
-Cherchant à identifier grâce à des règles adaptées des lignes potentiellement identiques. Deux enregistrements ayant le même mail, ou le même numéro de téléphone, ou le même identifiant pour les entreprises ;
-Cherchant grâce à des algorithmes de calcul de distance à définir les valeurs proches en termes d’orthographe, de prononciation, de caractères communs etc.
Au regard de ces quelques exemples et de nos propres expériences, il est possible de constater que ce type d’erreur provient principalement des processus de saisie, de collecte ou de « scrapping » des données qu’ils soient mis en œuvre automatiquement ou par des humains. Ainsi outre les solutions que l’on peut mettre en œuvre dans les traitements de préparations de données, l’amélioration de ces étapes préalables permettra également d’améliorer grandement la qualité des données à traiter, et cela passe par l’éducation, la formation et la définition de règles et de normes clairement connues et partager (la data gouvernance n’est jamais loin).
Enfin, il convient également de se demander au regard de cette étape, quand nous pouvons considérer comme suffisamment propre. En effet, nous pouvons toujours faire plus et mieux, mais souvent les coûts engendrés peuvent dépasser les retours espérés.
Dans le monde informatique, il existe une image visant à résumer ce type de problématique :
Souvent l’erreur se situe entre l’écran et le siège !
Et oui, même les meilleurs data scientists, data analysts ou data engineers peuvent se tromper dans les étapes de nettoyage, de transformation et de préparation des données.
Fréquemment, nous manipulons plusieurs fichiers issus de différentes sources, de différentes applications, ce qui multiplie les risques liés aux problématiques de données sales et les risques lors de la manipulation des fichiers en eux-mêmes :
Et ce problème peut être également rendu plus complexe en fonction des outils utilisés dans le cadre de nos analyses :
Il s’agit dans ce cas souvent de contraintes techniques liées au métier même de préparation de données et prendre le temps d’appréhender les risques et les processus en place permettra de gagner un temps important sur la mise à disposition d’analyse de données fiables et performantes.
Dans le prochain article, nous allons explorer le 3ème type d’obstacle que nous pouvons rencontrer lorsque nous utilisons les données pour éclairer le monde qui nous entoure : Les Erreurs Mathématiques
Cet article est inspiré fortement par le livre ” Avoiding Data pitfalls – How to steer clear of common blunders when working with Data and presenting Analysis and visualisation” écrit par Ben Jones, Founder and CEO de Data Litercy, édition WILEY. Nous vous recommandons cette excellente lecture!
Pour retrouver l’intégralité des sujets qui seront abordés au cours de cette série par ici : https://www.datanalysis.re/blog/business-intelligence/data-les-7-pieges-a-eviter-intro/
Dans le monde de la donnée, il s’agit d’un sujet central et critique. En effet, nous avons été familiarisés avec le processus de transformation de la donnée, en informations, en connaissance et en élément de sagesse :
Ici le problème trouve sa source dans la manière dont nous considérons notre point de départ : les données ! En effet, l’utilisation de celle-ci et sa transformation au cours des étapes suivantes relèvent de procédés et processus conscients et maîtrisés :
==>Je nettoie ma donnée, la traite dans un ETL / ELT, la stocke, la visualise, communique mon résultat et le partage etc. Cette maîtrise nous donne le contrôle sur la qualité des étapes. Toutefois, on aura tendance à se lancer dans ce travail de transformation de notre ressource primaire en omettant un point crucial, source de notre premier obstacle :
LA DONNEE N’EST PAS UNE REPRESENTATION EXACTE DU MONDE REEL !
En effet, il est excessivement simple de travailler avec des données en pensant aux données comme étant la réalité elle-même et pas comme des données collectées à propos de la réalité. Cette nuance est primordiale :
Regardons ensemble ce dashboard présentant l’ensemble des impacts de météorites sur la Terre entre -2500 et 2012. Pouvez vous identifiez ce qu’il y a d’étranges ici ?
Les météorites semblent avoir évité soigneusement certaines parties de la planète, une large part de l’Amérique du Sud, de l’Afrique, de la Russie, du Groenland etc. Et si l’on se concentre sur le graphique montrant le nombre de météorites par années, que celles-ci ont eu tendance à tomber plutôt dans les 50 dernières années (et presque pas sur l’ensemble de la période couvrant -2055 à 1975).
Est-ce qu’il s’agit bien de la réalité ? Ou plutôt de défauts dans la manière dont les données ont été collectées
Parfois, la cause de cet écart entre la donnée et la réalité peut être expliqué par un défaut du matériel de collecte. Malheureusement, tout ce qui est fabriqué par un être humain en ce bas monde est susceptible d’être défaillant. Cela vaut pour les capteurs et les instruments de mesure évidemment.
Que s’est-il passé les 28 et 29 avril 2014 sur ce pont ? Il semblerait qu’il y ait un énorme pic de traversée du pont de Fremont par des vélos mais uniquement dans un seul sens (courbe bleue).
On pourrait penser qu’il s’agissait d’une magnifique journée d’été et que tout le monde est passé sur le pont en même temps ? D’une course de vélos n’empruntant celui-ci que dans un sens ? Que tous les pneus de toutes les personnes ayant traversé le pont à l’aller ont crevé avant le retour ?
Plus prosaïquement, il s’avère que le compteur bleu avait un défaut ces jours précis et ne comptait plus correctement les traversées du pont. Un simple changement de batterie et du capteur et le problème a été résolu.
Maintenant, posez vous la question du nombre de fois où vous avez pu être induit en erreur par des données issues d’un capteur ou d’une mesure défaillante sans que cela n’ait été perçu ?
Et oui, nos propres biais humains ont un effet important sur les valeurs que nous enregistrons lors de la collecte d’informations. Nous avons par exemple tendance à arrondir les résultats des mesures :
Si l’on s’en fit à ses données, le changement des couches se fait plus régulièrement toutes les 10 minutes (0, 10, 20, 30, 40, 50) et parfois sur certains quarts d’heure (15, 45). Cela serait assez incroyable n’est-ce pas ?
Il s’agit bien d’un récit incroyable. En effet, il faut se pencher ici sur la manière dont les données ont été collectées. En tant qu’être humain, nous avons cette tendance à arrondir les informations lorsque nous les enregistrons, notamment lorsque nous regardons une montre ou une horloge : pourquoi ne pas indiquer 1:05 lorsqu’il est 1 :04 ? ou encore plus simple 1:00 car c’est plus simple encore ?
On retrouvera ce type de simplification humaine dans toutes les collectes de mesures : poids, tailles, etc.
Dernier exemple que nous souhaitons mettre en avant ici, et ce que l’on appelle l’effet « Cygne Noir ». Si nous pensons que les données dont nous disposons sont une représentation exacte du monde qui nous entoure et que nous pouvons en sortir des affirmations à graver dans le marbre ; alors nous nous trompons fondamentalement sur ce qu’est une donnée (cf. précédemment).
Le meilleur usage des données est d’apprendre ce qui n’est pas vrai à partir d’une idée préconçue et de nous guider dans les questions que nous devons nous poser pour en apprendre plus ?
Mais revenons à notre cygne noir :
Avant la découverte de l’Australie, toutes les observations de cygne jamais faite pouvaient conforter les européens que tous les cygnes étaient blancs, à tort ! En 1697, l’observation d’un cygne noir a remis intégralement en question cette préconception commune.
Et le lien avec les données ? De la même manière que l’on aura tendance à croire qu’une observation répétée est une vérité générale ; à tort ; on peut être amener à inférer que ce que nous voyons dans les données que nous manipulons peut s’appliquer de manière générale au monde qui nous entoure et à toute époque. C’est une erreur fondamentale dans l’appréciation des données.
Il suffit pour cela d’une légère gymnastique mentale et d’un peu de curiosité :
Dans le prochain article, nous allons explorer le 2ème type d’obstacle que nous pouvons rencontrer lorsque nous utilisons les données pour éclairer le monde qui nous entoure : Les Erreurs Techniques
Pour retrouver l’intégralité des sujets qui seront abordés au cours de cette série par ici : https://www.datanalysis.re/blog/business-intelligence/data-les-7-pieges-a-eviter-ep-1-7/
Accompagner nos clients dans leurs projets de transformation numérique et d’analyse de données.
Partenaires majeurs des entreprises de l’océan Indien pour leurs projets autour de la données, DATANALYSIS dans le cadre de son expansion recrute un Consultant Sénior BI & Data Visualisation.
Véritable actif stratégique des entreprises, la donnée est aujourd’hui au cœur des enjeux de performance économique et concurrentielle. Nos équipes maîtrisent parfaitement son cycle de vie et les leviers pour que cette donnée devienne une information précieuse. Pour nous aider à aller encore plus loin et pour offrir une expertise additionnelle à nos clients, nous recherchons un profil alliant expertises technologiques et savoir-faire métier pour participer à la réalisation des projets de Business Intelligence de nos clients.
Intégré à une équipe de 8 consultants sénior spécialisés en BI Self-Service, en Data visualisation, Machine Learning et IA, votre poste vous amènera à :
• Participer au cadrage des besoins des entreprises,
• Être force de proposition quant à la réalisation de solutions décisionnelles, en mode Agile,
• Proposez des analyses visuelles claires et génératrices de valeur pour leurs utilisateurs,
• Exploiter vos compétences techniques dans le traitement et la valorisation des données.
Vous aimez relever les nouveaux défis et vous savez faire preuve d’engagement pour réussir et évoluez aisément dans un environnement dynamique.
Vous vous intéressez naturellement à vos clients pour savoir dans quelle mesure vous pouvez les aider à résoudre leurs problèmes.
Vous possédez un bon esprit d’analyse et de synthèse, un excellent relationnel.
VOUS PROFITEREZ PLEINEMENT DE CE POSTE SI…
• Vous disposez d’une forte appétence pour les nouvelles technologies.
• Vous avez des compétences avancées dans l’une ou plusieurs des technologies suivantes :
o 3-5 ans d’expérience minimum sont attendus en développement sur Qlikview/Qliksense
o Des compétences Tableau Software sont un vrai plus
• Vous faites également preuve également de capacités de gestion de projet, de recueil de besoin,
La curiosité, l’intérêt pour le monde de la donnée, de la data visualisation et de l’IA sont des vraies plus.
Enfin, et surtout, vous êtes chaleureux, souriant, dynamique et vous avez un bon esprit d’équipe. Vous aimez rendre service en apportant du soin à la qualité de votre travail.
OÙ TRAVAILLEREZ-VOUS ?
Le poste est basé à la Saline, commune de Saint Paul, la Réunion. Des déplacements sur toute l’île, et potentiellement sur l’île Maurice et Madagascar sont à prévoir.
Pour la rentrée 2021, DATANALYSIS se lance un nouveau challenge ! La société étant déjà présente sur les belles îles de la Réunion et Maurice (sous la marque Business Lab Consulting), nous avions envie d’élargir notre scope d’activités et de continuer à explorer les données à travers l’Océan Indien.
La grande île est en pleine essor et malgré l’instabilité qu’on lui connaît, elle se développe grâce à de nombreux secteurs industriels à forte valeur ajoutée comme l’agro-industrie, le textile, les nouvelles technologies, le tourisme ou encore l’artisanat.
Stéphane MASSON et son équipe ne ratent jamais une occasion de faire connaître leur méthodologie et leur expertise leur permettant d’aider efficacement une nouvelle clientèle.
Et pour pouvoir avancer de façon construite et réfléchie, rien de mieux qu’avoir un partenaire local !
Représentée par Monsieur Jacques RAKOTOARIVELO, S@PHIR, entreprise de conseils en informatique, a choisi de mener cette aventure à nos côtés et nous en sommes reconnaissants.
Munis de nos meilleurs outils, nous sommes donc prêts à relever le défi, jongler avec de nouvelles données et par-dessus tout : aider et accompagner le marché malgache à prendre les meilleures décisions qu’il soit. #wearedatapeople
Et comment mieux les écouter que de développer des plateformes analytiques mettant à disposition de tous les opérateurs des données fiables et disponibles simplement (et évidemment dans le respect de la RGPD) ?
Avant la COVID-19, l’un des objectifs majeurs pour les organisations était de devenir « Customer-Centric » (organisé autour des besoins, des enjeux, des attentes et des contraintes du client). Cet objectif est devenu d’autant plus critique. Il est nécessaire de penser son entreprise en repensant les processus, et donc les flux de données et les outils d’analyses associées autour de vos clients, et non en silos ou en département.
La clé sera de personnaliser vos expériences et communication et d’associer pleinement les différents départements et services à cet effort de changement. Pour ce faire, nous vous donnons quelques éléments clés autour de deux axes sur lesquels orienter votre réflexion :
L’objectif principal ici est de savoir si vous disposez de toutes les informations qui vous permettent de comprendre vos clients. Avez-vous accès aux données externes à votre entreprise ? Savez-vous les récupérer ? Savez-vous les croiser avec les données dont vous disposez déjà ? Un investissement dans de nouvelles sources d’informations pour votre organisation sera probablement nécessaire pour atteindre vos clients et tâter leur pouls sur toutes les plateformes où ils peuvent discuter de vos produits.
Une fois que les données sont obtenues, traitées, intégrées et exploitables (de manière éthique et respectueuse de la vie privée) avec celles issues de vos outils traditionnels, il est important de pouvoir les utiliser simplement grâce à votre plateforme self-service d’analyse. Votre objectif sera d’identifier et comprendre les nouveaux besoins de vos clients : est-ce que vos segmentations ont bougé ? Est-ce que les comportements d’achats ont évolué (fréquence, montant, panier, remise, produits etc.) ? Comment est-ce que j’adapte mes opérations pour répondre à mon nouvel environnement ?
Vous avez à disposition toutes les données vous permettant de comprendre les nouvelles attentes de vos clients, c’est très bien ! Mais il ne faut pas oublier d’organiser vos méthodes de travail et vos outils pour arriver à exploiter parfaitement ce nouveau gisement d’information.
Nous l’avons vu dans la série précédente sur la Data Governance, la clé pour qu’une solution d’analyse de données soit réellement efficiente, vous offre un véritable retour sur investissement, et permette à votre organisation d’exploiter son plein potentiel est de prévoir une organisation adaptée :
Comme souvent, on en revient toujours à une conclusion similaire. La clé pour pouvoir exploiter parfaitement les données et engager ses clients est à la fois dans l’établissement des capacités (construire la plateforme analytique et l’alimenter en données) et dans le développement des méthodes de travail (stratégie, rôles, processus, et formation) qui permettront de les exploiter et prendre les bonnes décisions.
Se concentrer sur un des aspects du problème et oublier le second est le meilleur moyen de ne pas être dans les « starting blocks » pour la réouverture prochaine et laisser ces concurrents prendre une avance non négligeable !