Explorative Datenanalyse
Die explorative Datenanalyse ist die Untersuchung eines Datensatzes ohne vorgängige Hypothese, um zu erfahren, was er enthält, bevor daraus etwas abgeleitet wird. Die Analystin prüft die Integrität des Datenextrakts, beschreibt jede Variable, misst deren Abhängigkeiten, behandelt fehlende Werte und Ausreisser und zeichnet Diagramme, bis klar ist, was die Daten zulassen. Der IIBA-Leitfaden stellt sie dem Hypothesentest, dem maschinellen Lernen und der statistischen Inferenz voran: Ihr Ergebnis ist ein Urteil über die Daten und über die Forschungsfrage, die sich mit ihnen bearbeiten lässt.
Ziel
Die explorative Datenanalyse befragt einen Datensatz vor jedem analytischen Entscheid und beantwortet drei Fragen: welche Daten vorliegen, in welchem Zustand sie sind und welche Forschungsfrage sich mit ihnen bearbeiten lässt. Der IIBA-Leitfaden hält die Absicht fest: aus den Daten das Maximum herausholen, indem man sie prüft, analysiert und zusammenfasst, um mit ihnen vertraut zu werden, bevor formalere Verfahren zum Zug kommen.
Der Begriff stammt von John Tukey, dessen Werk von 1977 die Disziplin begründet, indem es zwei Arbeitsweisen gegenüberstellt. Die konfirmatorische Analyse geht von einer Hypothese aus und will sie entscheiden. Die explorative Analyse geht von den Daten aus und fördert Regelmässigkeiten, Auffälligkeiten und prüfenswerte Hypothesen zutage; Tukey beschreibt sie als Ermittlungsarbeit, geleistet, bevor das Gericht tagt. Das NIST-Handbuch liefert die operative Formulierung: eine Philosophie davon, wie man einen Datensatz zerlegt, was man darin sucht und wie man hinschaut und deutet.
Das Ergebnis ist ein Befundbericht. Er enthält das Inventar der Variablen und ihrer Eigenschaften, die Behandlung fehlender Werte und der Ausreisser samt Begründung, die Abhängigkeiten zwischen den Variablen, die vorläufigen Hypothesen und die Neuformulierung der Forschungsfrage. Dieser Bericht bindet die weitere Arbeit: Er sagt, was sich modellieren lässt, was neu erhoben werden muss und was dieser Extrakt nicht beantworten wird. Die Exploration stellt eine verzerrte Stichprobe fest; sie korrigiert sie nicht.
Die Exploration liefert eine vorläufige Hypothese, welche die Hypothesenbildung und -prüfung anschliessend an eigens dafür zurückbehaltenen Daten prüft. Sie ist auch die Voraussetzung für Data Mining, das nach dem Muster sucht, aus dem ein produktives Modell werden soll, während die Exploration beim Urteil über die Daten stehen bleibt.
Einsatz
Wann einsetzen
- Unbekannter Datensatz: der erste Extrakt aus einem Quellsystem, dessen tatsächlichen Inhalt niemand kennt, ebenso wenig den Anteil an Doubletten, leeren Feldern und unmöglichen Werten.
- Vor jeder Modellierung: ermitteln, was die Daten hergeben, und eine noch weit gefasste Forschungsfrage auf das eingrenzen, was sich mit dem Vorhandenen messen lässt.
- Datenübernahme oder Migration: das Data-Profiling des bestehenden Datenbestands bestimmt die Transformationsregeln.
- Neue Quelle zur Integration: prüfen, ob sie die erwartete Grundgesamtheit abdeckt, bevor sie in den Bestand aufgenommen wird.
- Bestrittener Befund: den Extrakt von Grund auf neu durcharbeiten, um festzustellen, was die Zahlen belegen.
Wann nicht einsetzen
- Hypothese auf bereits bekannten Daten: zur Hypothesenbildung und -prüfung übergehen.
- Befund für eine Geschäftsleitung: Explorationsdiagramme sind ausserhalb ihres Kontexts unlesbar; zu bevorzugen sind Geschäftsvisualisierungen.
Beschreibung
Das Schema in neun Schritten
Der IIBA-Leitfaden schlägt eine typische und iterative Abfolge vor, von der er festhält, dass sie die Praxis strukturiert, ohne die Reihenfolge festzulegen.
- Stimmigkeit und Integrität beim Laden prüfen: Dimensionen des Datensatzes, Anzahl Zeilen, Spaltenbezeichnungen und -typen, Umfang der fehlenden Werte. An dieser Stelle die Trainingsmenge von der Validierungsmenge trennen.
- Jede Variable beschreiben: Typ und Form der Verteilung, zentrale Tendenz (Mittelwert, Median, Modus), Varianz, Schiefe, Wölbung.
- Interdependenz und Kollinearität messen: Korrelationen, Varianzinflationsfaktor, ANOVA, t-Test, F-Test, Chi-Quadrat-Test.
- Fehlende Werte und Ausreisser behandeln: Ersatz durch Mittelwert, Median oder Modus, bayessche oder algorithmische Imputation, Anwendung einer Geschäftsregel.
- Bei den nützlichen Schritten Diagramme zeichnen und daraus die ersten Befunde ziehen.
- Die abgeleiteten Variablen bilden: Aggregate, Verhältniszahlen, Zusammenfassungen von Ausprägungen, berechnete Kennzahlen. Dieser Schritt heisst Merkmalskonstruktion, im üblichen Sprachgebrauch feature engineering. Jede abgeleitete Variable kehrt zu Schritt 2 zurück, der sie wie die übrigen beschreibt.
- Eine einfache Hypothese formulieren und erproben, um zu prüfen, ob ein Befund standhält.
- Die Forschungsfrage neu formulieren, ausgehend von dem, was die Exploration gezeigt hat. Eine Neuformulierung startet die ganze Runde ab Schritt 1 neu.
- Die ersten Befunde vermitteln, mit Diagrammen belegt und mit den anderswo gewonnenen Bestätigungen.
Das Schema richtet sich nach der Art der Daten, was der Leitfaden an zwei Fällen ausführt. Ein Bilddatensatz verlangt eine Dimensionsreduktion und eine Vektorisierung, bevor eine deskriptive Statistik überhaupt Sinn ergibt. Ein Textkorpus verlangt das Entfernen der Stoppwörter und eine Auszeichnung der Wortarten. Die Schritte 1 und 7 bis 9 gelten in allen Fällen; die Schritte 2 bis 6 wechseln den Inhalt.
Jeder Entscheid wird festgehalten, wenn er fällt: die ausgeschiedene Zeile und der Grund, der gewählte Schwellenwert, die abgeleitete Variable und ihre Formel, die Version des Extrakts. Dieses Journal macht die Exploration reproduzierbar. Drei Wochen später nachgeführt, wird es zu einer Rekonstruktion aus dem Gedächtnis, deren Abstand zum tatsächlichen Vorgehen sich nicht mehr messen lässt.
Die Diagramme sind das Instrument der Analystin
Der Leitfaden macht die Diagramme zum wichtigsten Träger des Verständnisses: Die Form einer Verteilung oder ein Ausreisser sind auf einen Blick zu lesen, wo eine Statistiktabelle Mühe kostet. Die Wahl des Diagramms hängt von der Anzahl Variablen ab, davon, ob sie kategorial oder stetig sind, und vom Schritt im Schema.
| Familie | Diagramme | Was daraus zu lesen ist | Schritte |
|---|---|---|---|
| Univariat | Histogramm, Kurve der Wahrscheinlichkeitsverteilung, Verlaufsdiagramm der Werte in Erfassungsreihenfolge | Form und Streuung der Verteilung einer Variablen, Häufigkeiten, Drift im Lauf der Erhebung | 1, 2 |
| Bivariat | Balkendiagramm, Streudiagramm, Boxplot, Korrelations-Heatmap | Tendenz zwischen zwei Variablen, Ausreisser, Interdependenz und Kollinearität | 3, 4 |
| Für besondere Zwecke | Streudiagramm-Matrix, Höhenliniendiagramme, Dichtekurven, Netzdiagramm, Verzögerungsdiagramm (lag plot) und Autokorrelogramm, Weibull-, logarithmische und log-normale Diagramme | Mehr als zwei Variablen zugleich, die dominierende Variable unter vielen, die Struktur einer Zeitreihe, eine über mehrere Grössenordnungen gestreute Verteilung | 3, 5, 6 |
Der Leitfaden trennt die Diagramme, die dem Verstehen eines Phänomens dienen, von jenen, die einen Befund vermitteln. Ein Explorationsdiagramm verträgt ohne Weiteres fünfzehn Datenreihen, rohe Achsen und keinerlei Gestaltung, weil seine einzige Leserin weiss, was sie darin sucht. Dasselbe Bild vor einen Ausschuss zu bringen, ist Sache der Geschäftsvisualisierungen und des Data Storytelling, die von einer einzigen Aussage und einer benannten Adressatin ausgehen.
Befunde vermitteln und absichern
Der Leitfaden verlangt, dass die Befunde durch andere Techniken der Business Analyse validiert werden, bevor sie geteilt werden. Die Geschäftsregelanalyse erklärt einen Ausreisser durch eine Erfassungsregel oder eine fehlende Kontrolle. Die Prozessanalyse erklärt ein leeres Feld durch einen Schritt, den niemand ausführt. Die Elizitation bei den Personen, die das System betreiben, entscheidet zwischen Datenanomalie und gewolltem Verhalten.
Die Vermittlung dokumentiert das befolgte Schema, die zugrunde gelegten Hypothesen, die Entscheidungspunkte und die Herkunft der Daten, genauso wie den Befund selbst. Ein Befund, der ohne seinen Weg geliefert wird, lässt sich weder bestreiten noch nachvollziehen.
Die Fallstricke
Der Rückzug ins Quantitative
Der Leitfaden zählt diese Abweichung zu den Grenzen der Technik: Die Analystin vertieft sich in die vorhandenen Daten und verliert die gestellte Frage aus dem Blick. Das Symptom ist eine Exploration, die sich hinzieht und Korrelationen hervorbringt, mit denen niemand etwas anzufangen weiss. Die Forschungsfrage steht zuoberst im Explorationsjournal und wird bei jeder Iteration neu gelesen. Eine Arbeitssitzung mit einer Person aus dem Fachbereich schliesst jede Runde ab: Der Leitfaden macht die Technik von der Branchenkenntnis ebenso abhängig wie von der Statistik.
Die aus der Exploration geborene und an denselben Daten geprüfte Hypothese
Ein lange genug betrachteter Datensatz zeigt am Ende Regelmässigkeiten, die der Zufall allein erklärt. Eine während der Exploration gefundene und dann am selben Extrakt getestete Hypothese bestätigt sich von selbst. Das ist die Trennung, die Tukey zwischen den beiden Arbeitsweisen setzt: Die Exploration schlägt vor, die Konfirmation entscheidet an Daten, welche die Exploration nicht gesehen hat. Das Schema des Leitfadens setzt sie um, indem es die Trainingsmenge bereits im ersten Schritt von der Validierungsmenge trennt, vor jeder Untersuchung: Die zweite wird geöffnet, um zu erproben, was die erste nahegelegt hat.
Der Ausreisser, der für einen Fehler gehalten wird
Ein Wert ausserhalb der Norm ist ein Erfassungsfehler oder der aussagekräftigste Punkt des Datensatzes. Ein Schadenfall über CHF 480'000 in einem Portefeuille mit einem Median von CHF 2'400 ist womöglich genau das Ereignis, das man vorhersagen will. Wie er behandelt wird, entscheidet sich anhand der Herkunft des Werts, die im Quellsystem gefunden oder als nicht auffindbar festgehalten wird. Der Abstand zum Mittelwert zeigt den Wert an; er erklärt ihn nicht.
Die Imputation, die Information erzeugt
Fehlende Werte durch den Mittelwert zu ersetzen, verengt die Varianz und schafft eine künstliche Masse in der Mitte der Verteilung. Angewandt auf die fünfzehn Prozent der Zeilen im nachstehenden Beispiel, verzerrt das Verfahren jede danach berechnete Statistik. Zuerst die Geschäftsregel suchen, welche die Lücke erklärt: Ein leeres Feld hat fast immer eine Ursache im Prozess. Erst danach den Rest imputieren. Jede Imputation wird mit einer Indikatorvariablen markiert, damit später erkennbar ist, welche Zeilen einen erzeugten Wert tragen.
Annahmen, die einen Umgebungswechsel nicht überstehen
Der Leitfaden hält fest, dass Modelle, die auf den Annahmen einer Exploration beruhen, schlecht skalieren, wenn sich Geschäftsumfeld und Ziele deutlich ändern, was eine Wiederholung der Exploration erzwingt. Die Gegenmassnahme ist, die Annahmen zu datieren und für jede die geschäftliche Bedingung zu benennen, von der sie abhängt. Eine Tarifänderung oder die Eröffnung eines Verkaufskanals liest sich dann als abgelaufene Annahme statt als unerklärte Drift des Modells.
KI-Überlegungen
Der erste Einsatz ist die Erzeugung des Explorationscodes. Aus dem Datenwörterbuch und einem Extrakt schreibt ein Assistent in wenigen Minuten den Durchgang der deskriptiven Statistik, die Korrelationsmatrix und die erste Serie von Diagrammen, eine repetitive Arbeit, bei der der Tippfehler mehr kostet als das Nachdenken. Der zweite ist die Deutung einer ungewöhnlichen Form: Eine bimodale Verteilung, ein schwerer Verteilungsrand oder eine schlecht ausgerichtete Saisonalität erhält eine Liste möglicher Erklärungen, welche die Analystin danach im Quellsystem prüft. Der dritte ist das Verfassen des Befundberichts aus dem Explorationsjournal, dessen Aufbau feststeht und dessen Inhalt bereits entschieden ist.
Drei Grenzen umgeben diese Einsätze. Das Modell kennt den Prozess nicht, der die Daten hervorbringt: nach der Ursache eines leeren Felds gefragt, liefert es eine plausible Erklärung, wo die Technik eine bei den Betreibern des Systems erhobene Erklärung verlangt. Werkzeuge zur automatischen Exploration, die auf einen blossen Ladevorgang hin einen Bericht mit mehreren hundert Diagrammen ausgeben, bringen die weiter oben beschriebene Abweichung in vollem Umfang zurück: quantitatives Material im Überfluss, ohne Forschungsfrage, die es sortiert. Schliesslich arbeitet die Exploration an Produktivdaten, oft an Personendaten. Sie an einen gehosteten Dienst zu senden, ist ein Entscheid im Sinne des revidierten Bundesgesetzes über den Datenschutz (revDSG), SR 235.1, der fällt, bevor der Assistent beigezogen wird. Ein anonymisierter Extrakt oder eine Verarbeitung auf selbst betriebener Infrastruktur sind die beiden üblichen Auswege.
Beispiele
Ein Genfer Onlinehändler verfügt über 18'400 Bestellungen aus zwölf Monaten und will wissen, ob er das Retourenrisiko modellieren kann. Der nachstehende Befundbericht ist das, was ihm die Exploration übergibt.
| Variable | Was die Exploration zeigt | Entscheid |
|---|---|---|
| bestellbetrag (stetig) | Mittelwert CHF 214, Median CHF 138, rechtsschiefe Verteilung. 23 Bestellungen über CHF 5'000 | Mit dem Logarithmus des Betrags arbeiten. Die 23 Zeilen sind Bestellungen von Wiederverkäufern, ausserhalb des Perimeters |
| anzahl_artikel (stetig) | Korrelation von 0,81 mit bestellbetrag | Kollinearität: nur eine der beiden Variablen kommt in ein lineares Modell |
| kanton (kategorial, 26 Ausprägungen) | 71% der Bestellungen auf GE und VD, neun Kantone unter 20 Bestellungen | Zu vier Ausprägungen zusammenfassen: GE, VD, übrige Westschweiz, Deutschschweiz und italienische Schweiz zusammen |
| lieferfrist_t (stetig) | 2'760 fehlende Werte (15,0%), alle bei im Laden abgeholten Bestellungen | Geschäftsregel: Abholung im Laden, Frist null. Keine statistische Imputation |
| retoure (binär) | 1'601 Retouren, also 8,7% der Bestellungen | Kandidat für die Zielvariable. Unausgewogene Klassen, beim Modell zu behandeln |
| kanal × retoure (Kreuztabelle) | App 858 Retouren auf 5'200 Bestellungen (16,5%), Website 634 auf 9'900 (6,4%), Terminal im Laden 109 auf 3'300 (3,3%) | Vorläufige Hypothese, formell zu prüfen |
Der Bericht zieht keinen Schluss zum Retourenrisiko. Er hält fest, dass auf diesem Extrakt ein Modell möglich ist, unter drei schriftlich festgehaltenen Bedingungen: von den beiden Variablen eine einzige Betragsvariable, eine Zusammenfassung der Kantone, eine Behandlung der Klassenungleichheit. Der Unterschied zwischen den Kanälen ist die einzige Spur, welche die Exploration zutage gefördert hat, und ihn zu bestätigen setzt eine Prüfung an der im ersten Schritt beiseitegelegten Validierungsmenge voraus, was Sache der Hypothesenbildung und -prüfung ist. Die Zeile zur Lieferfrist zeigt die Reihenfolge der Behandlung: Die 2'760 Lücken sind die Spur einer Liefermethode, und eine Imputation über den Median hätte für fünfzehn Prozent der Bestellungen Lieferfristen erzeugt, die es nie gegeben hat.
Visualisierungen
Die Stellung der explorativen Analyse in der Analysekette ist der einzige Gegenstand dieser Fiche, dessen Sinn an räumlichen Beziehungen hängt: ein Eingang, die erschlossenen Daten; ein einziger Ausgang, der Befundbericht; zwei Zweige, die davon abgehen, zum Hypothesentest und zum Data Mining; eine Rückkehr zur Quelle, wenn der Extrakt nicht genügt. Ein Satz zählt sie auf, ohne zu zeigen, dass beide Fortsetzungen am selben Ergebnis hängen, an einem Bericht, der die Daten beurteilt und dort aufhört. Es wird gezeichnet.
Die Typologie der Diagramme und der Befundbericht sind Raster aus Zeilen und Spalten. Sie als Bild zu drucken, kostete die erste ihre Spalte mit den Schritten, die eine Leserin überfliegt, um ihren eigenen zu finden; den zweiten kostete es, was ihn zum Ergebnis macht: markierbaren, durchsuchbaren und auf dem Mobiltelefon lesbaren Text. Die Diagramme selbst zu zeichnen, wäre eine Vorführung statistischer Grafik, Gegenstand einer anderen Fiche. Das Schema in neun Schritten ist ein nummeriertes Verfahren: Die beiden Stellen, an denen es zurückspringt, werden bei dem Schritt benannt, der sie auslöst; eine Zeichnung mit neun Kästchen wiederholte die neun Beschriftungen, um zwei Pfeile hinzuzufügen.
Die Abbildung zur Stellung in der Analysekette dient ein zweites Mal, neben eine laufende Exploration gelegt: Sie fragt, wo die Arbeit steht. Ein Team, das bereits über zu behaltende Variablen, über die Trainingsmenge und über Modellgüte spricht, hat einen Zweig gewählt, bevor der Befundbericht geschrieben war, also bevor die Daten beurteilt waren. Eine Frage prüft das im Review: Welches geschriebene Dokument sagt, was sich mit diesem Extrakt nicht machen lässt?
Aufwand
| Phase | Stufe | Begründung |
|---|---|---|
| Vorbereitung | Mittel | Einen repräsentativen Extrakt, die Zugriffsrechte und das Datenwörterbuch zu erhalten, führt über den Eigner der Quelle und über den Datenschutz. Diese Wartezeit übersteigt oft die Dauer der Analyse. |
| Durchführung | Hoch | Der Durchlauf ist iterativ und bemisst sich in Tagen je Datensatz. Die Beherrschung einer wissenschaftlichen Software und einer Programmiersprache gehört zu den Grenzen, die der Leitfaden festhält, eine Kompetenz, die das Tempo bestimmt. |
| Dokumentation | Mittel | Das Journal wird laufend geführt und der Befundbericht in einem halben Tag verfasst. Was kostet, ist die Disziplin: Ein Entscheid, der nicht am selben Tag festgehalten wird, findet sich nicht wieder. |
Werkzeuge
Die Tabellenkalkulation genügt für einige tausend Zeilen und ein Dutzend Spalten: Pivot-Tabelle, Histogramm, Sortierung nach einer Spalte, um die Extreme zu sehen. Ihre Grenzen liegen beim Volumen und bei der Reproduzierbarkeit, denn eine mit der Maus geführte Exploration lässt sich nicht wiederholen.
Sobald eine dieser beiden Grenzen erreicht ist, arbeitet man in einer Programmiersprache: R und Python besetzen das Feld, mit ihren Bibliotheken für Tabellenverarbeitung, statistische Berechnung und Grafik; der Leitfaden nennt sie unter den Kompetenzen, welche die Technik verlangt. Die Einstiegskosten liegen eher in der Kompetenz als in der Lizenz, da die Werkzeuge quelloffen sind.
Das Notebook (Jupyter, Quarto, R Markdown) ist der Träger des Explorationsjournals: Code, Resultat und Kommentar stehen in einer einzigen versionierten Datei, was Schritt 9 fast zum Nulltarif macht.
Die Data-Profiling-Werkzeuge erstellen mit einem Befehl das Porträt eines Extrakts: Typen, fehlende Werte, Verteilungen, paarweise Korrelationen. Sie nehmen Schritt 1 und einen Teil von Schritt 2 ab. Sie stellen keine Frage, weshalb ihr Bericht ein Ausgangspunkt bleibt.
Das Datenwörterbuch und der Katalog geben Bedeutung, Einheit und Herkunft der Spalten, ohne die die Exploration Zahlen beschreibt, deren Bedeutung niemand kennt. Die Dashboard-Werkzeuge passen schlecht zu diesem Schritt, da sie eine bereits gewählte Sicht voraussetzen, während die Exploration darin besteht, dreissig davon auszuprobieren.
Quellen
- IIBA, Guide to Business Data Analytics, §3.11 Exploratory Data Analysis: die Definition, das Schema in neun Schritten, die Typologie der Diagramme, die Vermittlung der Befunde, die Stärken und die Grenzen.
- John W. Tukey, Exploratory Data Analysis, Addison-Wesley, 1977: das grundlegende Werk, die Gegenüberstellung von explorativer und konfirmatorischer Analyse, der Boxplot.
- NIST/SEMATECH, e-Handbook of Statistical Methods, Kapitel 1: Exploratory Data Analysis: die operative Definition und die Ziele der Exploration.
- Bundesgesetz über den Datenschutz (revDSG), SR 235.1: der Schweizer Rahmen für das Senden von Personendaten an einen gehosteten Dienst.

