Your Training Partner
Techniken-Toolbox
Die Abfolge des Hypothesentests, die sieben Schritte des Leitfadens zu fünf Stufen zusammengefasst, durchschnitten von einer senkrechten Trennlinie: links, was vor der Datenerhebung festgelegt wird; rechts, was danach berechnet wird.

Hypothesenbildung und -prüfung

Der Hypothesentest ist das Verfahren, das eine bezifferte Aussage über eine Grundgesamtheit einer Datenstichprobe gegenüberstellt. Nimmt man die Aussage als wahr an, sagt der Test, ob die beobachtete Stichprobe unwahrscheinlich genug ist, um die Aussage zu verwerfen. Man schreibt zwei einander ausschliessende Aussagen auf. Die Nullhypothese unterstellt das Ausbleiben einer Wirkung; die Alternativhypothese trägt die zu prüfende Überzeugung. Danach wird, bevor man die Daten ansieht, das Mass an Unwahrscheinlichkeit festgelegt, ab dem die Nullhypothese fällt. Der IIBA-Leitfaden ordnet die Technik der Problemanalyse zu und verortet die Kompetenz der Analystin in der Formulierung der Aussage und im Lesen des Ergebnisses; die Berechnung liegt beim Datenteam.

Ziel

Der Hypothesentest entscheidet über eine fachliche Behauptung, die niemand geprüft hat: die Reklamationsquote ist gesunken, diese Variante kostet weniger. Er macht aus der Behauptung eine Aussage, der Daten widersprechen können, und stellt sie dann nach einer vorab festgelegten Regel einer Stichprobe gegenüber. Der IIBA-Leitfaden weist ihm diese Aufgabe zu: eine intuitive Einschätzung in eine überprüfbare und messbare zu überführen, damit Entscheidungen nicht allein nach Gefühl fallen.

Das Arbeitsergebnis besteht aus zwei Teilen. Ein Protokoll wird vor der Erhebung geschrieben und enthält die beiden Hypothesen, die gemessene Variable, die gewählte Teststatistik, den Stichprobenumfang, das Signifikanzniveau und die Entscheidungsregel. Eine Ergebnisnotiz nennt danach den beobachteten Wert, die berechnete Teststatistik, die Entscheidung über Verwerfen oder Beibehalten der Nullhypothese und das Konfidenzintervall.

Die Technik folgt auf die explorative Datenanalyse, die die mögliche Regelmässigkeit sichtbar macht, und sie stützt sich für Stichprobenziehung, Schätzung und Intervall auf die deskriptive und inferenzielle Statistik. Hinzu kommt eine Entscheidungsregel, die vor der Erhebung feststeht.

Einsatz

Wann einsetzen

  • Teure Überzeugung aus Erfahrung: eine Führungskraft behauptet eine Abweichung, die niemand gemessen hat, und die Entscheidung bindet ein Budget.
  • Entscheidung auf Basis einer Stichprobe: Umfrage, Pilotprojekt oder Panel, dessen Aussage für die ganze Grundgesamtheit gelten soll.
  • Vergleich zweier Gruppen oder zweier Zeiträume: vorher und nachher, Kanton gegen Kanton, wo die beobachtete Abweichung blosses Rauschen sein kann.
  • Ergebnis, das bestritten werden wird: Aufsichtsbehörde, Prüfungsausschuss, Partner; das vor der Erhebung datierte Protokoll macht die Schlussfolgerung haltbar.

Wann nicht einsetzen

  • Ganze Grundgesamtheit verfügbar: die deskriptive Statistik liefert die Abweichung ohne Test.
  • Frage nach der Ursache: der Test qualifiziert eine Abweichung, ohne sie zu erklären, ein randomisiertes Experiment wie das A/B-Testing stellt den Zusammenhang her.
  • Keine Hypothese in Sicht: noch nichts zu widerlegen, die explorative Datenanalyse liefert die Spur.

Beschreibung

Zwei einander ausschliessende Aussagen

Die Nullhypothese, geschrieben H0, ist die Ausgangsposition: keine Wirkung, Gleichheit mit dem Referenzwert. Die Alternativhypothese, geschrieben H1, ist deren Verneinung und trägt die zu prüfende Überzeugung. Der Test befragt nur eine von beiden: er misst, wie unwahrscheinlich die beobachteten Daten wären, wenn H0 zuträfe. Er verwirft H0, sobald diese Unwahrscheinlichkeit ein vorab festgelegtes Niveau überschreitet.

Die Richtung von H1 bestimmt die Form des Tests. Ein zweiseitiger Test erfasst jede Abweichung vom Referenzwert in beide Richtungen und verteilt das Risiko auf die beiden Enden der Verteilung. Ein einseitiger Test erfasst nur eine Richtung und bündelt das Risiko auf einer Seite, was ihn geeigneter macht, eine Abweichung in dieser Richtung zu entdecken. Die Richtung ergibt sich aus der fachlichen Frage und wird vor der Erhebung gewählt: von einem zweiseitigen auf einen einseitigen Test zu wechseln, sobald das Vorzeichen der Abweichung bekannt ist, verdoppelt das angekündigte Risiko.

Das Niveau wird vor dem Blick auf die Daten festgelegt

Das Signifikanzniveau, geschrieben α, ist das Risiko, eine zutreffende Nullhypothese zu verwerfen. Das NIST definiert es als einen Wert, den derjenige, der den Test durchführt, selbst und im Voraus festlegt. In der Praxis sind 5% üblich, bei schweren Folgen einer falschen Verwerfung auch 1%. Die Entscheidungsregel übersetzt dieses Niveau in einen mechanischen Vergleich: H0 verwerfen, wenn die Teststatistik jenseits des kritischen Werts liegt, auf der Seite, die H1 bezeichnet.

Sobald die Daten vorliegen, lässt sich jedes Niveau nachträglich begründen, und der Beobachtungszeitraum verkürzt sich so lange, bis die Abweichung erscheint. Das vor der Erhebung geschriebene und datierte Protokoll ist es, was ein Ergebnis von einer nachträglich arrangierten Vorführung unterscheidet.

Die zwei Fehler und was sie kosten

Getroffene EntscheidungH0 trifft zu (keine Wirkung)H0 trifft nicht zu (reale Wirkung)
H0 verwerfenFehler 1. Art, mit Wahrscheinlichkeit α: man handelt auf eine Wirkung hin, die es nicht gibtRichtige Entscheidung
H0 beibehaltenRichtige EntscheidungFehler 2. Art, mit Wahrscheinlichkeit β: man lässt eine reale Wirkung durchgehen

Die beiden Risiken lassen sich nicht auf dieselbe Weise steuern. α wird frei festgelegt, denn es ist das Niveau selbst. β hängt von der wirklichen Abweichung zwischen Grundgesamtheit und Nullhypothese ab, die niemand kennt, aber auch vom Stichprobenumfang, von der Streuung und von α. Man senkt es, indem man die Stichprobe vergrössert oder nur noch eine grössere Abweichung entdecken will. 1 − β heisst Teststärke, die Wahrscheinlichkeit, eine vorhandene Wirkung zu entdecken.

Die Wahl von α ist eine fachliche Entscheidung. Wenn falsches Handeln teuer und schwer rückgängig zu machen ist, eine landesweite Einführung, eine Vertragsneuverhandlung, senkt man α. Wenn das Übersehen einer realen Wirkung mehr kostet, ein Jahr für Jahr liegen gelassenes Sparpotenzial, hält man α bei 5% und nimmt die Kosten einer grösseren Stichprobe in Kauf, um Teststärke zu gewinnen. Beide Fehler vor dem Test in Franken zu beziffern, macht diese Wahl in der Sitzung verhandelbar.

Das Vorgehen

Der IIBA-Leitfaden gliedert den Ablauf in sieben Schritte.

Die Hypothese formulieren. "Das Programm senkt die Kosten" lässt sich nicht testen. "Die durchschnittlichen jährlichen Leistungskosten der im Programm eingeschriebenen Versicherten liegen unter CHF 4'800" lässt sich testen, weil Variable, Grundgesamtheit und Referenzwert darin benannt sind. H0 erhält das Ausbleiben der Wirkung, H1 die erwartete Richtung.

Die Teststatistik wählen. Die Wahl richtet sich nach der Form der Daten: Vergleich eines Mittelwerts mit einem Referenzwert, Vergleich zweier Anteile, Vergleich von Varianzen, Verteilung von Häufigkeiten auf Kategorien. Die gängigen Familien heissen t-Test, z-Test, F-Test und Chi-Quadrat-Test. Das Datenteam entscheidet; die Analystin nennt die Bedingungen, die diese Wahl voraussetzt, und prüft, ob die Daten sie erfüllen. Der Leitfaden hält fest, dass eine sauber formulierte Hypothese die zugrunde liegende Variable nicht zu einer Normalverteilung zwingt.

Das Signifikanzniveau festlegen. Zugleich wird der Stichprobenumfang bestimmt, ausgehend von der kleinsten Abweichung, die eine Massnahme rechtfertigen würde. Eine nachträglich bemessene Stichprobe ist eine vom gewünschten Ergebnis bemessene Stichprobe.

Die Entscheidungsregel festhalten. Sie nennt den kritischen Wert und die Seite der Verteilung, die H1 bezeichnet.

Die Stichprobe erheben und rechnen. Die Art der Ziehung wiegt schwerer als die Arithmetik. Der Leitfaden zählt die Sparsamkeit der Erhebung zu den Stärken: die Formulierung begrenzt die Datenmenge, die zur Prüfung einer Behauptung nötig ist.

Entscheiden, ohne die festgehaltene Regel zu ändern. Das Ergebnis wird in den Worten des Protokolls ausgesprochen: H0 auf dem Niveau von 5% verworfen oder H0 beibehalten.

Die Erkenntnisse vermitteln. Sagen, was das Ergebnis erlaubt, was die gemessene Abweichung wert ist und was offen bleibt.

Was lässt sich aus einem Ergebnis schliessen?

Der p-Wert ist, wie ihn die Stellungnahme der American Statistical Association definiert, die Wahrscheinlichkeit, Daten zu beobachten, die mindestens so extrem sind wie die erhaltenen, unter der Annahme, dass die Nullhypothese und das gewählte statistische Modell zutreffen. Er gibt also weder die Wahrscheinlichkeit an, dass H0 zutrifft, noch jene, dass die Daten dem Zufall geschuldet sind: beide Lesarten kehren die Bedingung um und sind die verbreitetsten Fehldeutungen.

Eine beibehaltene Nullhypothese belegt, dass die Daten ihr auf dem gewählten Niveau nicht stark genug widersprechen. Eine zu kleine Stichprobe erzeugt dasselbe Urteil wie eine tatsächliche Gleichheit. Deshalb geht ein Test, der H0 beibehält, immer mit seiner Teststärke oder mit dem Konfidenzintervall der Abweichung einher; sonst nimmt die Leserschaft das Ergebnis als Beweis für Gleichheit. Der Leitfaden macht daraus eine seiner Grenzen: die Ergebnisse sind probabilistisch und werden mit ihrem Signifikanzniveau und ihrem Intervall weitergegeben.

Statistische und praktische Signifikanz

Eine statistisch signifikante Abweichung ist eine Abweichung, die der Stichprobenzufall schlecht erklärt. Ihre Grösse geht nicht in das Urteil ein. Die Stellungnahme der ASA macht daraus einen Grundsatz: die statistische Signifikanz misst weder das Ausmass einer Wirkung noch deren Bedeutung. Mit einer genügend grossen Stichprobe überschreitet eine Abweichung von CHF 2 pro Kunde die Schwelle ebenso sicher wie eine Abweichung von CHF 200.

Die fachliche Entscheidung stützt sich auf zwei Lesarten zugleich: die erste sagt, dass die Abweichung real ist, die zweite vergleicht Abweichung und Intervall mit den Kosten der Handlung, die sie auslösen würde. Eine signifikante Abweichung, deren Konfidenzintervall die Kosten des sie erzeugenden Programms überdeckt, rechtfertigt keine Einführung, und eine nicht signifikante Abweichung aus einem Pilotprojekt mit dreissig Personen rechtfertigt keinen Abbruch.

Die Fallstricke

Das nachträglich verschobene Niveau

Die sichtbare Form ist das von 5% auf 10% angehobene Niveau, das ein Ergebnis retten soll. Die unauffällige Form ist häufiger: man testet zwölf Segmente, drei Kanäle und zwei Zeiträume, und einer der siebzehn Tests fällt signifikant aus. Auf dem Niveau von 5% und bei siebzehn unabhängigen Tests liegt die Wahrscheinlichkeit, dass mindestens einer die Schwelle aus reinem Zufall überschreitet, bei 58%. Zwei Vorkehrungen entschärfen diesen Fallstrick: das Protokoll nennt, welche Tests durchgeführt werden, und das Niveau wird bei einer unvermeidbaren Testreihe um deren Anzahl korrigiert, was die Bonferroni-Korrektur leistet.

Eine Stichprobe ohne Auswahlregel

Der Test setzt eine bekannte Auswahlregel voraus. Eine Gruppe von Freiwilligen, eine Datei von Umfrageteilnehmenden, die nach den Abgängen verbliebene Kundschaft: diese drei Erhebungen erzeugen dasselbe statistische Ergebnis wie eine reale Wirkung, ohne dass eine Wirkung besteht. Die gemessene Abweichung betrifft dann die Art, wie die Menschen in die Stichprobe gelangt sind. Das Protokoll nennt die angestrebte Grundgesamtheit und die Art der Ziehung; der Unterschied zwischen beiden wird zusammen mit dem Ergebnis gemeldet.

Gleichheit, abgeleitet aus einer beibehaltenen Nullhypothese

"Kein signifikanter Unterschied" kommt in der Sitzung als "die beiden Optionen sind gleichwertig" an, und die Entscheidung folgt. Die Ergebnisnotiz macht dem ein Ende, indem sie das Intervall nennt: eine Abweichung zwischen −CHF 20 und CHF 900 pro Dossier lässt die Frage offen.

Der Test als Schlussfolgerung genommen

Der Leitfaden zählt zu seinen Grenzen, dass ein Test die statistische Belastbarkeit einer Behauptung belegt, ohne die Analyse zu ersetzen. Wer sich allein auf ihn verlässt, übersieht die Signale, die eine Datenexploration gezeigt hätte: eine zweigipflige Verteilung, einen datierten Bruch in der Zeitreihe. Ein Test ohne Exploration beantwortet eine schlecht gewählte Frage korrekt.

Ein Ergebnis, das niemand lesen kann

Der Leitfaden hält die Schwierigkeit fest, das Verfahren und sein Ergebnis den Anspruchsgruppen zu vermitteln; er empfiehlt, ihr Vertrauen auf einfachen Beispielen aufzubauen. Ein Protokoll von einer Seite, ein Referenzwert, den der Fachbereich wiedererkennt, und ein Satz, der die Entscheidung ausspricht, sind mehr wert als der Output einer Statistiksoftware. Die Vermittlung fällt danach unter das Data Storytelling.

KI-Überlegungen

Der erste Einsatz betrifft die Formulierung. Eine vage fachliche Behauptung vorzulegen und drei bezifferte Paare aus H0 und H1 zu verlangen, jedes mit seiner Variablen und seiner Grundgesamtheit, zwingt dazu, das Unausgesprochene zu benennen. Denselben Dienst leistet das Modell bei der Wahl der Testfamilie: die Form der Daten zu beschreiben und zu fragen, welche Bedingungen der vorgesehene Test voraussetzt, ergibt eine Liste von Prüfungen, die noch durchzuführen sind.

Der zweite Einsatz ist die Ausführung: aus einem bereits geschriebenen Protokoll den R-, Python- oder SQL-Code erzeugen, der die Teststatistik und das Intervall berechnet. Der dritte ist die Übersetzung des Ergebnisses für ein Gremium. Ein Modell schreibt den Output einer Statistiksoftware in einen einzigen Satz um, der die Entscheidung ausspricht, und schlägt das einfache Beispiel vor, das das Verfahren verständlich macht.

Über die Gültigkeit des Tests entscheidet die Art, wie die Stichprobe zustande kam, und genau die kennt das Modell nicht: aus Daten von Freiwilligen wird es ohne Zögern eine Schlussfolgerung ziehen. Es kann α nicht festlegen, eine Abwägung zwischen zwei fachlichen Kosten, die nur die Organisation beziffert. Vor allem findet ein Assistent, den man fragt, welche Abweichungen in einem Datenbestand die Schwelle überschreiten, immer welche: nachträglich zu suchen kostet nichts mehr. Der einzige Schutz bleibt das der Erhebung vorausgehende Protokoll. Hinzu kommt die Sensibilität der Daten, die es verbietet, Leistungsdossiers oder personenbezogene Lohndaten in einen ausserhalb der Organisation gehosteten Dienst zu geben.

Beispiele

Eine Krankenkasse in der Westschweiz testet ein Coaching-Programm zur Diabetesprävention an 220 Versicherten, bevor sie über die Ausweitung auf ihren gesamten Bestand entscheidet. Das nachstehende Protokoll ist vor der Datenextraktion datiert.

Bestandteil des ProtokollsVor der Erhebung festgelegter Wert
Gemessene VariableJährliche Leistungskosten in CHF pro eingeschriebene Person
Nullhypothese H0Die durchschnittlichen Jahreskosten der gecoachten Versicherten entsprechen den Referenzkosten des Bestands, CHF 4'800
Alternativhypothese H1Sie liegen unter CHF 4'800
TestartEinseitig nach links, Vergleich eines Mittelwerts mit einem Referenzwert
Signifikanzniveauα = 5%, kritischer Wert −1,65 (grosse Stichprobe, Normalapproximation)
EntscheidungsregelH0 verwerfen, wenn die Teststatistik unter −1,65 liegt
Stichprobe220 im Programm eingeschriebene Versicherte, zwölf Monate Leistungen
ErgebnisWert
Beobachtete durchschnittliche JahreskostenCHF 4'350
Abweichung von den ReferenzkostenCHF 450
Standardabweichung der StichprobeCHF 900
Standardfehler des Mittelwerts900 ÷ √220 = CHF 61
Teststatistik(4'350 − 4'800) ÷ 61 = −7,4
Entscheidung−7,4 liegt unter −1,65, H0 auf dem Niveau von 5% verworfen
95%-Konfidenzintervall der Abweichung, per Konvention zweiseitig450 ± 1,96 × 61 = CHF 330 bis CHF 570

Die Ausweitung des Programms kostet CHF 380 pro Versicherten und Jahr. Die erwartete Nettoeinsparung beträgt damit CHF 70 pro Versicherten, in einem Intervall von −CHF 50 bis CHF 190: die Kostensenkung ist auf dem gewählten Niveau belegt, der Nettogewinn nicht. Eine Notiz, die beim statistischen Urteil stehen bleibt, bringt das Gremium dazu, das Programm auf den gesamten Bestand auszuweiten.

Die 220 Versicherten haben sich selbst eingeschrieben. Das Protokoll zielte auf die versicherte Grundgesamtheit, geliefert hat die Erhebung Freiwillige. Wer ein Präventionsprogramm wählt, sorgt von Anfang an besser für sich. Die haltbare Schlussfolgerung betrifft die festgestellten Kosten dieser Versicherten. Die Abweichung dem Coaching zuzuschreiben, verlangt eine Zufallszuteilung der Teilnehmenden. Dieser Unterschied zwischen angestrebter Grundgesamtheit und erhaltener Stichprobe wird dem Gremium zusammen mit der Zahl gemeldet.

Visualisierungen

Zwei Teile der Technik verlangen eine grafische Form. Die Entscheidungsabfolge wird gezeichnet, weil ihr Wert in der Reihenfolge der Schritte liegt und in der Trennlinie, die das vor der Erhebung Festgelegte vom danach Berechneten scheidet. Das Paar aus statistischer und praktischer Signifikanz wird als Quadrant gezeichnet, weil die beiden Achsen unabhängig sind und jedes der vier Felder eine andere Handlung nahelegt.

Der Rest wird als Tabelle geschrieben: das Protokoll trägt einen Bestandteil pro Zeile, die Matrix der zwei Fehler kreuzt den wahren Zustand mit der getroffenen Entscheidung. Eine Ergebnisnotiz gewinnt zudem an Klarheit, wenn sie das Konfidenzintervall der Abweichung auf einer Frankenskala zeigt, auf der die Kosten der Handlung als Marke stehen; diese Darstellung gehört zu den Geschäftsvisualisierungen.

Aufwand

PhaseStufeBegründung
VorbereitungMittelDas Protokoll zu schreiben kostet eine Sitzung mit dem Fachbereich, in der Referenzwert, Testrichtung und Niveau ausgehandelt werden.
DurchführungGeringDie Berechnung ist eine Funktion der Tabellenkalkulation oder eine Zeile aus einer Statistikbibliothek. Der Aufwand steckt im Zustandekommen der Stichprobe, das zur vorgelagerten Datenaufbereitung gehört.
DokumentationGeringProtokoll und Ergebnisnotiz umfassen je eine Seite. Einmal zusammen mit der Abfrage archiviert, die die Stichprobe erzeugt hat, verlangen sie keine Pflege.

Werkzeuge

Das Protokoll wird in einem versionierten Dokument verfasst, und das Werkzeug zählt weniger als der Zeitstempel: eine Seite in der Dokumentenablage des Projekts, vor der Extraktion freigegeben, genügt als Nachweis der Vorgängigkeit.

Die Tabellenkalkulation deckt die gängigen Fälle ab. Excel und LibreOffice Calc bieten Funktionen für den t-Test und die Normalverteilung, dazu ein Analyse-Add-in für z-Test, F-Test und Chi-Quadrat. Sie eignen sich für einen einzelnen Test auf einer bereits gezogenen Stichprobe und stossen an ihre Grenze, sobald die Berechnung bei jeder Datenaktualisierung zu wiederholen ist.

Statistikumgebungen sind das Werkzeug des Datenteams: R mit seinen nativen Funktionen, Python mit SciPy und statsmodels. Sie liefern Teststatistik, p-Wert und Intervall in einem Befehl, halten die Berechnung in einem lesbaren Skript fest und decken die Bemessung des Stichprobenumfangs ab. Teststärkerechner wie G*Power leisten dasselbe für alle, die nicht programmieren.

SQL baut die Stichprobe und die Aggregate, die in den Test eingehen, selten den Test selbst. BI-Plattformen zeigen Konfidenzintervalle und Unsicherheitsbänder um einen Trend; sie dienen der Wiedergabe eines anderswo gewonnenen Ergebnisses, und ein standardmässig auf einem Dashboard angezeigtes Intervall liest sich oft wie ein Test, der nie formuliert wurde.

Quellen

Gruppierung
Alle Techniken
IDEF / IGOE