Your Training Partner
Toolbox des techniques
Diagramme montrant l'analyse exploratoire des données comme passage obligé entre les données sourcées et deux techniques en aval, la formulation et le test d'hypothèses ainsi que le data mining, avec un retour vers les données sourcées.

Analyse exploratoire des données

L'analyse exploratoire des données est l'examen d'un jeu de données sans hypothèse préalable, pour savoir ce qu'il contient avant d'en tirer quoi que ce soit. L'analyste contrôle l'intégrité de l'extrait, décrit chaque variable, mesure leurs dépendances, traite les valeurs manquantes et aberrantes, puis trace des graphiques jusqu'à savoir ce que la donnée autorise. Le guide de l'IIBA la place en amont du test d'hypothèses, de l'apprentissage automatique et de l'inférence statistique: son produit est un jugement sur les données et sur la question de recherche qu'elles permettent de traiter.

Objectif

L'analyse exploratoire des données interroge un jeu de données avant toute décision d'analyse et répond à trois questions: quelles données sont disponibles, dans quel état elles se trouvent et quelle question de recherche elles permettent de traiter. Le guide de l'IIBA en fixe l'intention: maximiser ce que l'on tire de la donnée en l'examinant, en l'analysant et en la résumant, pour acquérir de l'aisance avec elle avant d'appliquer des approches plus formelles.

Le terme vient de John Tukey, dont l'ouvrage de 1977 fonde la discipline en opposant deux régimes de travail. L'analyse confirmatoire part d'une hypothèse et cherche à la trancher. L'analyse exploratoire part de la donnée et laisse remonter les régularités, les anomalies et les hypothèses qu'il vaudra la peine de tester; Tukey la décrit comme un travail d'enquête, mené avant que le tribunal ne siège. Le manuel du NIST en donne la formulation opérationnelle: une philosophie de la façon dont on découpe un jeu de données, de ce qu'on y cherche, de la manière de regarder et d'interpréter.

Le livrable est une note de constats. Elle porte l'inventaire des variables et de leurs caractéristiques, le traitement des valeurs manquantes et aberrantes avec sa justification, les dépendances entre variables, les hypothèses préliminaires et la reformulation de la question de recherche. Cette note engage la suite du travail: elle dit ce qui peut être modélisé, ce qui doit être collecté à nouveau et ce à quoi cet extrait ne répondra pas. L'exploration constate un échantillon biaisé; elle ne le corrige pas.

L'exploration produit une hypothèse préliminaire, que la formulation et le test d'hypothèses éprouvent ensuite sur des données réservées à cet effet. Elle est aussi le préalable du data mining, qui cherche la régularité destinée à devenir un modèle déployé, alors que l'exploration s'arrête au jugement sur les données.

Données sourcées
Systèmes source
Extrait
Dictionnaire de données
Analyse exploratoire des données
Note de constats
Variables · traitements · dépendances · hypothèses préliminaires
donnée à re-collecter
Formulation et test d'hypothèses
Hypothèse à confirmer sur des données non explorées
Data Mining
Régularité à modéliser puis déployer
Décision métier
Position de l'analyse exploratoire des données dans la chaîne analytique. Son livrable est une note de constats, qui ouvre soit le test d'une hypothèse sur des données que l'exploration n'a pas vues, soit la recherche d'une régularité destinée à un modèle.

Usage

Quand l'utiliser

  • Jeu de données inconnu: premier extrait reçu d'un système source, dont personne ne connaît le contenu réel ni la part de doublons, de champs vides et de valeurs impossibles.
  • Avant toute modélisation: établir ce que la donnée supporte et resserrer une question de recherche encore large sur ce qui est mesurable avec l'existant.
  • Reprise ou migration de données: le profilage de l'existant conditionne les règles de transformation.
  • Nouvelle source à intégrer: vérifier qu'elle couvre la population attendue avant de l'ajouter au socle.
  • Constat contesté: reprendre l'extrait à zéro pour établir ce que les chiffres autorisent à dire.

Quand ne pas l'utiliser

  • Hypothèse posée sur des données déjà connues: passer à la formulation et au test d'hypothèses.
  • Constat destiné à une direction: les tracés d'exploration sont illisibles hors contexte, préférer les visualisations métier.

Description

Le schéma en neuf étapes

Le guide de l'IIBA propose un enchaînement type et itératif, dont il précise qu'il structure la pratique sans figer l'ordre.

  1. Contrôler la cohérence et l'intégrité au chargement: dimensions du jeu, nombre d'enregistrements, libellés et types de colonnes, volume de valeurs manquantes. Séparer à ce moment le jeu d'entraînement du jeu de validation.
  2. Décrire chaque variable: type et forme de la distribution, tendance centrale (moyenne, médiane, mode), variance, asymétrie, aplatissement.
  3. Mesurer l'interdépendance et la colinéarité: corrélations, facteur d'inflation de la variance, ANOVA, test t, test F, test du khi-deux.
  4. Traiter les valeurs manquantes et les valeurs aberrantes: remplacement par la moyenne, la médiane ou le mode, imputation bayésienne ou algorithmique, application d'une règle métier.
  5. Tracer aux étapes utiles et en tirer les premiers constats.
  6. Construire les variables dérivées: agrégats, ratios, regroupements de modalités, indicateurs calculés. Cette étape s'appelle l'ingénierie des variables, feature engineering dans l'usage courant. Chaque variable dérivée repart à l'étape 2, qui la décrit comme les autres.
  7. Formuler et éprouver une hypothèse simple, pour vérifier qu'un constat tient debout.
  8. Reformuler la question de recherche à partir de ce que l'exploration a montré. Une reformulation relance le tour complet depuis l'étape 1.
  9. Restituer les premiers constats, tracés à l'appui, avec les corroborations obtenues ailleurs.

Le schéma se règle sur la nature de la donnée, ce que le guide énonce sur deux cas. Un jeu d'images demande une réduction de dimension et une vectorisation avant qu'une statistique descriptive ait un sens. Un corpus de texte demande le retrait des mots vides et un étiquetage morphosyntaxique. Les étapes 1 et 7 à 9 tiennent dans tous les cas; les étapes 2 à 6 changent de contenu.

Chaque décision se consigne quand elle est prise: la ligne écartée et le motif, le seuil retenu, la variable dérivée et sa formule, la version de l'extrait. Ce journal rend l'exploration reproductible. Reconstitué trois semaines plus tard, il devient une reconstruction de mémoire, dont l'écart avec ce qui a été fait ne se mesure plus.

Les tracés sont l'instrument de l'analyste

Le guide fait des graphiques le véhicule principal de la compréhension: une forme de distribution ou une valeur aberrante se lisent d'un coup d'œil là où un tableau de statistiques demande un effort. Le choix du tracé dépend du nombre de variables, de leur type catégoriel ou continu et de l'étape du schéma.

FamilleTracésCe qu'on y litÉtapes
UnivariésHistogramme, courbe de distribution de probabilité, graphique des valeurs dans l'ordre de collecteForme et étalement de la distribution d'une variable, fréquences, dérive au fil de la collecte1, 2
BivariésDiagramme en barres, nuage de points, boîte à moustaches, carte de chaleur des corrélationsTendance entre deux variables, valeurs aberrantes, interdépendance et colinéarité3, 4
À usage particulierMatrice de nuages de points, courbes de niveau, courbes de densité, graphique en radar, graphique de décalage (lag plot) et autocorrélogramme, tracés de Weibull, logarithmique et log-normalPlus de deux variables à la fois, variable dominante parmi beaucoup d'autres, structure d'une série temporelle, distribution étalée sur plusieurs ordres de grandeur3, 5, 6

Le guide sépare les tracés faits pour comprendre un phénomène de ceux faits pour restituer un constat. Un graphique d'exploration porte volontiers quinze séries, des axes bruts et aucune mise en forme, parce que son unique lecteur sait ce qu'il y cherche. Porter la même image devant un comité relève des visualisations métier et du data storytelling, qui repartent d'un message unique et d'un destinataire nommé.

Restituer et corroborer les constats

Le guide demande que les constats soient validés par d'autres techniques de business analyse avant d'être partagés. L'analyse des règles métier explique une valeur aberrante par une règle de saisie ou un contrôle absent. L'analyse des processus explique un champ vide par une étape que personne n'exécute. L'élicitation auprès des personnes qui exploitent le système tranche entre l'anomalie de données et le fonctionnement voulu.

La restitution porte le schéma suivi, les hypothèses retenues, les points de décision et la provenance des données, au même titre que le constat lui-même. Un constat livré sans son parcours ne peut être ni contesté ni rejoué.

Les pièges

Le repli sur le quantitatif

Le guide compte cette dérive parmi les limites de la technique: l'analyste s'absorbe dans les données présentes et perd de vue la question posée. Le symptôme se reconnaît à une exploration qui dure et produit des corrélations dont personne ne sait quoi faire. La question de recherche s'écrit en tête du journal d'exploration et se relit à chaque itération. Une séance de travail avec une personne du métier ferme chaque tour: le guide fait dépendre la technique de la connaissance du secteur autant que de la statistique.

L'hypothèse née de l'exploration et vérifiée sur les mêmes données

Un jeu de données assez longtemps observé finit par montrer des régularités que le hasard suffit à expliquer. Une hypothèse trouvée pendant l'exploration puis testée sur le même extrait se confirme d'elle-même. C'est la séparation que Tukey pose entre les deux régimes: l'exploration suggère, la confirmation tranche sur des données que l'exploration n'a pas vues. Le schéma du guide l'applique en séparant le jeu d'entraînement du jeu de validation dès la première étape, avant tout examen: le second s'ouvre pour éprouver ce que le premier a suggéré.

La valeur aberrante confondue avec l'erreur

Une valeur hors norme est une erreur de saisie ou le point le plus informatif du jeu. Un sinistre à CHF 480'000 dans un portefeuille dont la médiane est à CHF 2'400 est peut-être l'événement même que l'on cherche à prévoir. Le traitement se décide sur l'origine de la valeur, retrouvée dans le système source ou déclarée introuvable. La distance à la moyenne signale la valeur; elle ne l'explique pas.

L'imputation qui fabrique de l'information

Remplacer les valeurs manquantes par la moyenne resserre la variance et crée une masse artificielle au centre de la distribution. Appliqué aux quinze pour cent de lignes de l'exemple ci-dessous, le procédé déforme toute statistique calculée ensuite. Chercher d'abord la règle métier qui explique l'absence, puisqu'un champ vide a presque toujours une cause dans le processus, puis n'imputer que le reste. Toute imputation se marque par une variable indicatrice, pour que la suite du travail sache quelles lignes portent une valeur fabriquée.

Les hypothèses qui ne survivent pas au changement d'environnement

Le guide relève que les modèles bâtis sur les hypothèses d'une exploration passent mal à l'échelle quand l'environnement métier et les objectifs changent de façon marquée, ce qui oblige à reprendre l'exercice. La parade est de dater les hypothèses et de nommer, pour chacune, la condition métier dont elle dépend. Un changement de tarif ou l'ouverture d'un canal de vente se lit alors comme une hypothèse périmée plutôt que comme une dérive inexpliquée du modèle.

Considérations IA

Le premier emploi est la production du code d'exploration. À partir du dictionnaire de données et d'un extrait, un assistant écrit en quelques minutes la passe de statistiques descriptives, la matrice de corrélation et la première série de tracés, travail répétitif où la faute de frappe coûte plus cher que la réflexion. Le deuxième est l'interprétation d'une forme inhabituelle: une distribution bimodale, une queue épaisse ou une saisonnalité mal alignée reçoivent une liste d'explications candidates, que l'analyste vérifie ensuite dans le système source. Le troisième est la rédaction de la note de constats à partir du journal d'exploration, dont la structure est fixée et le contenu déjà décidé.

Trois limites encadrent ces emplois. Le modèle ignore le processus qui produit la donnée: interrogé sur la cause d'un champ vide, il fournit une explication vraisemblable là où la technique demande une explication établie auprès de qui exploite le système. Les outils d'exploration automatique, qui livrent sur un simple chargement un rapport de plusieurs centaines de graphiques, ramènent en volume la dérive décrite plus haut: du matériau quantitatif en abondance, sans question de recherche pour le trier. Enfin, l'exploration porte sur des données de production, souvent personnelles. Leur envoi vers un service hébergé est une décision au sens de la nouvelle loi fédérale sur la protection des données (nLPD), RS 235.1, prise avant de solliciter l'assistant. Un extrait anonymisé ou un traitement sur une infrastructure maîtrisée sont les deux issues courantes.

Exemples

Un détaillant en ligne genevois dispose de 18'400 commandes sur douze mois et veut savoir s'il peut modéliser le risque de retour. La note de constats ci-dessous est ce que l'exploration lui remet.

VariableCe que l'exploration montreDécision
montant_commande (continu)Moyenne CHF 214, médiane CHF 138, distribution étalée vers la droite. 23 commandes au-dessus de CHF 5'000Travailler sur le logarithme du montant. Les 23 lignes sont des commandes de revendeurs, hors périmètre
nb_articles (continu)Corrélation de 0,81 avec montant_commandeColinéarité: une seule des deux variables entrera dans un modèle linéaire
canton (catégoriel, 26 modalités)71% des commandes sur GE et VD, neuf cantons sous 20 commandesRegrouper en quatre modalités: GE, VD, reste de la Suisse romande, Suisse alémanique et italienne réunies
delai_livraison_j (continu)2'760 valeurs manquantes (15,0%), toutes sur des commandes retirées en magasinRègle métier: retrait en magasin, délai nul. Aucune imputation statistique
retour (binaire)1'601 retours, soit 8,7% des commandesVariable cible candidate. Classes déséquilibrées, à traiter au moment du modèle
canal × retour (croisement)Application 858 retours sur 5'200 commandes (16,5%), site web 634 sur 9'900 (6,4%), borne en magasin 109 sur 3'300 (3,3%)Hypothèse préliminaire, à éprouver formellement

La note ne conclut rien sur le risque de retour. Elle établit qu'un modèle est possible sur cet extrait, à trois conditions écrites: une variable de montant sur les deux, un regroupement des cantons, un traitement du déséquilibre des classes. L'écart entre canaux est la seule piste que l'exploration a fait remonter, et la confirmer suppose de la tester sur le jeu de validation mis de côté à la première étape, ce qui relève de la formulation et du test d'hypothèses. La ligne des délais montre l'ordre de traitement: les 2'760 absences sont la trace d'un mode de livraison, et une imputation par la médiane aurait fabriqué quinze pour cent de délais qui n'ont jamais existé.

Visualisations

La position de l'analyse exploratoire dans la chaîne analytique est le seul objet de cette fiche dont le sens tient à des relations spatiales: une entrée, la donnée sourcée; une sortie unique, la note de constats; deux branches qui en partent, vers le test d'hypothèses et vers le data mining; un retour vers la source quand l'extrait ne suffit pas. Une phrase les énumère sans montrer que les deux suites tiennent au même livrable, une note qui juge les données et s'arrête là. Elle se dessine.

La typologie des tracés et la note de constats sont des grilles de lignes et de colonnes. Les imprimer en image coûterait à la première sa colonne d'étapes, que le lecteur balaye pour trouver la sienne; à la seconde, ce qui en fait un livrable, un texte sélectionnable, cherchable et lisible sur un téléphone. Dessiner les tracés eux-mêmes serait une démonstration de graphiques statistiques, sujet d'une autre fiche. Le schéma en neuf étapes est une procédure numérotée: ses deux retours en arrière se nomment au pas qui les déclenche; un dessin de neuf boîtes redirait les neuf libellés pour ajouter deux flèches.

La figure de position sert une seconde fois, posée à côté d'une exploration en cours: elle demande où le travail se trouve. Une équipe qui parle déjà de variables à retenir, de jeu d'entraînement et de performance de modèle a choisi une branche avant d'avoir écrit la note de constats, donc avant d'avoir jugé les données. Une question le vérifie en revue: quel document écrit dit ce que cet extrait ne permet pas de faire.

Coût

PhaseNiveauJustification
PréparationMoyenObtenir un extrait représentatif, les droits d'accès et le dictionnaire de données passe par le propriétaire de la source et par la protection des données. Cette attente dépasse souvent la durée de l'analyse.
ExécutionÉlevéLe parcours est itératif et se compte en jours par jeu de données. La maîtrise d'un logiciel scientifique et d'un langage de programmation figure parmi les limites relevées par le guide, compétence qui conditionne le rythme.
DocumentationMoyenLe journal se tient au fil de l'eau et la note de constats se rédige en une demi-journée. Ce qui coûte est la discipline: une décision non consignée le jour même ne se retrouve pas.

Outils

Le tableur suffit pour quelques milliers de lignes et une dizaine de colonnes: tableau croisé dynamique, histogramme, tri sur une colonne pour voir les extrêmes. Il atteint sa limite sur le volume et la reproductibilité, puisqu'une exploration menée à la souris ne se rejoue pas.

Au-delà, la pratique se fait dans un langage de programmation: R et Python occupent le terrain, avec leurs bibliothèques de manipulation de tableaux, de calcul statistique et de tracé; le guide les cite parmi les compétences que la technique exige. Le coût d'entrée est dans la compétence plus que dans la licence, l'outillage étant libre.

Le notebook (Jupyter, Quarto, R Markdown) est le support du journal d'exploration: le code, le résultat et le commentaire tiennent dans un même fichier versionné, ce qui rend l'étape 9 presque gratuite.

Les outils de profilage de données produisent en une commande le portrait d'un extrait: types, valeurs manquantes, distributions, corrélations deux à deux. Ils absorbent l'étape 1 et une partie de l'étape 2. Ils ne posent aucune question, donc leur rapport reste un point de départ.

Le dictionnaire de données et le catalogue donnent le sens, l'unité et la provenance des colonnes, sans quoi l'exploration décrit des nombres dont personne ne sait ce qu'ils mesurent. Les outils de tableau de bord conviennent mal à cette étape, puisqu'ils supposent une vue déjà choisie quand l'exploration consiste à en essayer trente.

Sources

Analyse et gestion des risques
Toutes les techniques
Analyse financière