Deskriptive und schliessende Statistik
Die deskriptive Statistik fasst einen vorliegenden Datensatz zusammen: wo sich die Werte häufen, wie weit sie streuen, welche Form ihre Verteilung annimmt. Die schliessende Statistik erweitert diese Zusammenfassung auf eine Grundgesamtheit, die niemand vollständig gemessen hat, ausgehend von einer daraus gezogenen Stichprobe. Das Ergebnis ändert seine Natur: Die Antwort ist eine Schätzung mit einem Intervall und einem Konfidenzniveau.
Ziel
Deskriptive und schliessende Statistik sind die Masse, die einen Datensatz zusammenfassen und diese Zusammenfassung auf die Grundgesamtheit ausdehnen, aus der die Daten stammen. Die Technik greift dort, wo eine Entscheidung eine Zahl verlangt, die niemand vollständig gemessen hat. Der durchschnittliche Warenkorb eines Detailhändlers, die Zufriedenheit seiner Kundschaft, die Bearbeitungsdauer eines Dossiers bei der Versicherung: Jede dieser Grössen wird an einer Stichprobe geschätzt.
Der IIBA-Leitfaden verortet die Schwierigkeit in der Interpretation: die Daten quantifizieren, sie dann in ihrem fachlichen Zusammenhang lesen, bevor sie in eine Entscheidung einfliessen.
Das Ergebnis besteht aus zwei Teilen. Die deskriptive Statistik liefert ein Lagemass, ein Streuungsmass und die Form der Verteilung, sofern der Datentyp das zulässt. Die Schätzung liefert den gesuchten Wert, sein Konfidenzintervall und die Stichprobenbedingungen, die den Schluss zulässig machen.
Einsatz
Wann einsetzen
- Grundgesamtheit ausserhalb der Reichweite einer Vollerhebung: Einige hundert zufällig gezogene Beobachtungen schätzen einen Mittelwert auf wenige Prozent genau; die Nutzungsquote, die Zahlungsbereitschaft oder die Zufriedenheit geht mitsamt Intervall in einen Business Case ein.
- Vergleich zweier Zeiträume oder zweier Varianten: Zwei Mittelwerte lassen sich erst vergleichen, wenn ihre Streuung bekannt ist.
- Kennzahl, die zu definieren oder per Stichprobe zu überwachen ist: Fehlerquote, Antwortzeit, Zahl der Reklamationen, für die Lagemass und Streuungsmass festgelegt werden, bevor ein Zielwert beziffert wird.
- Zwischen Anspruchsgruppen umstrittene Grössenordnung: Die Rechnung ergibt dasselbe, unabhängig davon, wer sie liest, eine Stärke, die der IIBA-Leitfaden hervorhebt.
Wann nicht einsetzen
- Keine Messdaten zu den wirksamen Faktoren: Ein durch die Delphi-Methode strukturiertes Expertenurteil bringt mehr als eine scheingenaue Zahl.
- Mehrere Unsicherheiten, die eine Formel verknüpft: Die Entscheidungssimulation trägt die Bandbreiten bis ins Resultat.
Beschreibung
Zwei verschiedene Fragen
| Deskriptive Statistik | Schliessende Statistik | |
|---|---|---|
| Frage | Was sagen die Daten, die mir vorliegen? | Was kann ich über die Grundgesamtheit behaupten, die ich nicht gemessen habe? |
| Gegenstand | Der beobachtete Datensatz, unabhängig von seiner Herkunft | Eine Stichprobe aus einer definierten Grundgesamtheit |
| Voraussetzungen | Ein Datentyp, der zum berechneten Mass passt | Zufallsauswahl, unabhängige Beobachtungen, ausreichender Umfang |
| Ergebnis | Lage, Streuung, Form der Verteilung | Eine Schätzung, ihr Intervall und ihr Konfidenzniveau |
| Was es nicht sagt | Nichts über das, was nicht beobachtet wurde | Nichts über die Ursache des Geschätzten |
Zwei benachbarte Themen bleiben ausserhalb des Rahmens. Ob ein beobachteter Unterschied zwischen zwei Gruppen auf den Zufall der Stichprobe zurückgeht, entscheiden die Formulierung und die Prüfung einer Hypothese, mit Nullhypothese, Signifikanzniveau und Ablehnungsentscheid. Die Rohdaten vor der Zusammenfassung anzusehen und darin Ausreisser und Lücken zu suchen, gehört zur explorativen Datenanalyse. Konfidenzintervall und Hypothesentest lesen allerdings dieselbe Stichprobenverteilung, sodass eine Hypothese, die den Mittelwert ausserhalb des 95%-Intervalls ansetzt, vom zweiseitigen Test auf dem 5%-Niveau abgelehnt wird.
Der Datentyp entscheidet über das Mass
Ein stetiges Merkmal nimmt jeden Wert eines Bereichs an: einen Umsatz, eine Dauer. Ein diskretes Merkmal wird in ganzen Einheiten gezählt: eine Zahl von Mitarbeitenden, eine Zahl bestellter Artikel. Ein kategoriales Merkmal benennt eine Klasse ohne Rangfolge: einen Kanton, eine Produktlinie. Sind die Klassen geordnet, ist das Merkmal ordinal: eine Schulnote von 1 bis 6, eine Zufriedenheitsskala von "sehr unzufrieden" bis "sehr zufrieden".
Der IIBA-Leitfaden betont die Folge: Behandelt man ein ordinales Merkmal als Kategorie, geht die Rangfolge verloren, und eine ausgezeichnete Note wiegt dann so viel wie eine ungenügende. Ein Mittelwert über eine Zufriedenheitsskala unterstellt, dass der Abstand zwischen "unzufrieden" und "neutral" dem Abstand zwischen "zufrieden" und "sehr zufrieden" entspricht, wofür es keine Gewähr gibt. Eine mittlere Zufriedenheit von 3,7 auf fünf Stufen, ein mittleres Risikoniveau von 2,4, eine mittlere Priorität von 1,8: Solche Zahlen bevölkern die Dashboards und stammen aus einer Rechnung, die die Daten nicht hergeben.
Wo sich die Werte häufen
Der Mittelwert ist die Summe der Werte geteilt durch ihre Anzahl. Der Median teilt die Daten in zwei gleich grosse Hälften. Der Modus ist der häufigste Wert. Quantile zerlegen die Verteilung in gleich besetzte Abschnitte, Perzentile in Hundertstel und Quartile in Viertel.
Bei einer symmetrischen, glockenförmigen Verteilung fallen Mittelwert, Median und Modus zusammen, wie das NIST-Handbuch festhält, sodass die Wahl nicht auffällt. Sie fällt auf, sobald die Verteilung schief wird. Der Mittelwert folgt den Extremwerten, der Median widersteht ihnen. Sind mehrere Werte gleich häufig, gibt es mehr als einen Modus, was ihn als alleinige Zusammenfassung unhandlich macht. Der Median dient auch als Ersatzwert für fehlende Daten, worauf der IIBA-Leitfaden hinweist.
Wie weit sie streuen
Zwei Fonds derselben Bank weisen über zehn Jahre je 3,2% durchschnittliche Jahresrendite aus. Die Standardabweichung des ersten beträgt 1,1%, die des zweiten 9,4%. Der Mittelwert ist derselbe und die beiden Anlagen bergen nicht dasselbe Risiko. Der IIBA-Leitfaden macht daraus sein Argument für die Streuungsmasse.
Die Varianz ist der Durchschnitt der quadrierten Abweichungen vom Mittelwert. Die Standardabweichung ist deren Quadratwurzel. Beide tragen dieselbe Information und nur eine davon lässt sich vermitteln: Die Varianz steht in quadrierten Einheiten, in Quadratfranken, die der Leitfaden als Hindernis für fachliche Anspruchsgruppen bezeichnet. Die Standardabweichung kehrt in die Einheit des Mittelwerts zurück und wird neben ihm ausgewiesen.
Die Schiefe sagt, wohin die Verteilung neigt; die Wölbung sagt, wie schwer ihre Ränder wiegen, also wie häufig Extremwerte auftreten. Es sind Diagnosen: Sie entscheiden, ob der Mittelwert überhaupt berichtet werden soll. Eine ausgeprägte Rechtsschiefe, der Normalfall bei Beträgen und Dauern, hebt den Mittelwert über den Median und über das, was die Mehrheit der Beobachtungen wert ist.
| Form oder Datentyp | Lage | Streuung | Worauf zu achten ist |
|---|---|---|---|
| Stetig, symmetrische Verteilung | Mittelwert | Standardabweichung | Untergruppen mit abweichendem Verhalten, die das Paar verdeckt |
| Stetig, schiefe Verteilung oder mit Extremwerten | Median | Interquartilsabstand | Das Ausmass der Extremwerte, das der Interquartilsabstand definitionsgemäss ausblendet |
| Ordinal | Median | Verteilung nach Klasse | Der tatsächliche Abstand zwischen zwei Stufen, der nicht gemessen ist |
| Kategorial | Modus | Häufigkeiten je Klasse | Keine Rangfolge zwischen den Klassen: Weder Median noch Mittelwert ergibt einen Sinn |
| Diskret mit geringer Spannweite | Median oder Modus | Spannweite, Häufigkeiten | Ein Mittelwert mit Nachkommastellen entspricht keiner möglichen Beobachtung |
Grundgesamtheit, Stichprobe, Parameter, Statistik
Die Norm ISO 3534-1 legt das Vokabular von vier Begriffen fest, die die Praxis verwechselt. Die Grundgesamtheit ist die Menge der Einheiten, auf die sich die Frage bezieht: die 52'000 Transaktionen eines Quartals, die Schadenfälle einer Versicherungssparte. Der Parameter ist die auf dieser Grundgesamtheit gesuchte Grösse, etwa ihr Mittelwert, und er bleibt unbekannt, solange die Grundgesamtheit nicht vollständig gemessen ist. Die Stichprobe ist die beobachtete Teilmenge. Die Statistik ist dieselbe Grösse, berechnet auf dieser Stichprobe.
Die Statistik schätzt den Parameter, ohne ihm gleichzukommen. Die Unterscheidung bestimmt die Rechnung: Die Varianz einer Stichprobe, die diejenige der Grundgesamtheit schätzen soll, wird durch den um eins verminderten Umfang geteilt, wie es das NIST-Handbuch angibt; der IIBA-Leitfaden hält lediglich fest, dass sich die Momente um den Mittelwert anpassen.
Warum zwei Stichproben nie dieselbe Zahl ergeben
Eine zweite Stichprobe aus derselben Grundgesamtheit ergibt einen anderen Mittelwert. Diese Mittelwerte verteilen sich um den unbekannten Parameter nach einem eigenen Gesetz, der Stichprobenverteilung. Der Schluss auf die Grundgesamtheit ruht ganz auf ihr. Ihre Streuung misst der Standardfehler, die Standardabweichung der Stichprobe geteilt durch die Wurzel aus dem Stichprobenumfang.
Die Genauigkeit wächst mit der Wurzel des Umfangs. Eine Vervierfachung der Stichprobe halbiert den Standardfehler: Der Schritt von 400 auf 1'600 Beobachtungen kostet das Vierfache und bringt den Faktor zwei. Die Grösse der Grundgesamtheit geht nicht in die Rechnung ein: Einen Mittelwert für einen Kanton mit 300'000 Einwohnerinnen und Einwohnern oder für die ganze Schweiz zu schätzen, verlangt bei gleicher Genauigkeit eine Stichprobe von vergleichbarem Umfang.
Zwanzig gleich gebildete Intervalle
jedes Segment ist das Konfidenzintervall einer neuen Stichprobe
Das Konfidenzintervall
Das Konfidenzintervall ist ein auf der Stichprobe berechnetes Intervall, dessen Verfahren eine bekannte Trefferquote auf lange Sicht hat; Jerzy Neyman hat die vollständige Theorie dazu 1937 vorgelegt. Seine gängige Form für einen Mittelwert ist der Stichprobenmittelwert zuzüglich und abzüglich eines Vielfachen des Standardfehlers, abgelesen aus der t-Verteilung für Konfidenzniveau und Stichprobenumfang. Üblich ist das Niveau 95%.
Ein 95%-Konfidenzintervall besagt nicht, dass der wahre Mittelwert mit 95% Wahrscheinlichkeit darin liegt. Das aus einer bestimmten Stichprobe berechnete Intervall enthält den wahren Wert oder enthält ihn nicht. Das Konfidenzniveau ist eine Eigenschaft des Verfahrens: Würde man die Ziehung sehr oft wiederholen und das Intervall jedes Mal gleich bilden, so enthielten rund 95% dieser Intervalle den Mittelwert der Grundgesamtheit.
Was den Schluss zulässig macht
Drei Bedingungen machen den Schluss vertretbar. Die Auswahl erfolgt zufällig, das heisst, jede Einheit der Grundgesamtheit hat eine bekannte und von null verschiedene Wahrscheinlichkeit, gezogen zu werden. Die Beobachtungen sind unabhängig: Vier Antworten von vier Mitarbeitenden derselben Abteilung, die sich zuvor abgesprochen haben, zählen nicht als vier Beobachtungen. Der Umfang reicht aus für den Unterschied, den die Entscheidung erkennen muss, was sich vor der Erhebung berechnen lässt.
Das Bundesamt für Statistik wendet diese Bedingungen in der Schweizerischen Arbeitskräfteerhebung an: Jedes Quartal liefert eine aus einem Register gezogene Stichprobe Schätzungen, die mit ihrem Konfidenzintervall veröffentlicht werden. Daraus stammt die Erwerbslosenquote gemäss ILO. Die Arbeitslosenquote des SECO, die jeden Monat in der Presse steht, zählt die bei den Regionalen Arbeitsvermittlungszentren gemeldeten Personen und beruht auf keiner Stichprobe.
Der IIBA-Leitfaden nennt als erste seiner Grenzen die Pflicht, die Annahmen des Verfahrens zu benennen und festzuhalten. Neben die Zahl gehören die Grundgesamtheit, der Stichprobenrahmen, das Auswahlverfahren, der Umfang, die Ausfallquote und das, was die Nichtantwortenden womöglich unterscheidet. Eine Schätzung ohne diese Zeilen ist nicht prüfbar.
Der Erwartungswert, wenn das Ergebnis von Natur aus unsicher ist
Ist der Ausgang unsicher, so ist der Erwartungswert der mit den Wahrscheinlichkeiten gewichtete Durchschnitt der möglichen Werte. Ein Versicherer, der Motorfahrzeugschäden von CHF 2'000, CHF 1'500 und CHF 1'000 mit Wahrscheinlichkeiten von 0,5, 0,3 und 0,2 erwartet, rechnet mit einer Belastung von CHF 1'650 je Police. Kein einziger Schaden wird diesen Betrag erreichen; er ist gleichwohl die Grundlage der Tarifierung.
Der IIBA-Leitfaden weist hier auf einen Fehler in der Fragestellung hin: die falsche Grösse zu optimieren. Eine Organisation, die eine tiefere Fluktuationsquote anstrebt, optimiert eine Wahrscheinlichkeit, während ihr Ergebnis vom Erwartungswert des verlorenen Geschäfts abhängt, bei dem der Weggang eines Key Account Managers anders wiegt als der einer Stelle ohne Wirkung auf die Kundschaft.
Zwei Variablen zusammen betrachtet
Kovarianz und Korrelation messen, wie zwei Variablen gemeinsam schwanken; die zweite ist eine normierte Fassung der ersten und liegt zwischen -1 und 1. Eine starke Korrelation zeigt einen Zusammenhang an, der zu prüfen ist, sagt aber nichts über die Richtung der Kausalität und nichts über einen dritten Faktor, der beide erklären würde. Diesen Zusammenhang zu modellieren, um eine Variable aus der anderen vorherzusagen, gehört zur Regression.
Die Fallstricke
Das Intervall als Wahrscheinlichkeit gelesen
Der Ausschuss merkt sich "Mit 95% Wahrscheinlichkeit liegt der durchschnittliche Warenkorb zwischen 65 und 71 Franken": Der Satz kommt ihn im nächsten Quartal teuer zu stehen, wenn dieselbe Rechnung ein anderes Intervall ergibt.
Die grosse verzerrte Stichprobe
Ein hoher Umfang verengt das Intervall, korrigiert aber nichts an einer fehlerhaften Auswahl. Fünfzigtausend freiwillige Antworten auf einen Online-Fragebogen schätzen die Zufriedenheit derjenigen, die Online-Fragebogen beantworten, mit bemerkenswerter Genauigkeit und mit einer Verzerrung, auf die in der Rechnung nichts hinweist. Vierhundert zufällig aus der Kundendatenbank gezogene Personen sind mehr wert: Das Intervall beschreibt dann allein den Stichprobenfehler.
Die einzelne Zahl, die ihr Intervall überlebt
Die Schätzung verlässt die Analyse mit ihrem Intervall und erreicht den Ausschuss ohne es, weil eine Folie eine Zahl besser trägt als eine Spanne. Das Gegenmittel: die Untergrenze und die Obergrenze in dieselbe Zelle wie die Schätzung schreiben, schon in der Tabelle, damit keine Kopie sie trennen kann.
KI-Überlegungen
Der erste nützliche Einsatz ist die Wahl des Masses: Ein Sprachmodell, dem man die Struktur des Datensatzes, den Typ jeder Spalte und die gestellte Frage beschreibt, schlägt die zulässigen Lage- und Streuungsmasse vor und benennt die ordinale Spalte, über die ein Mittelwert gerechnet wird. Die Prüfung ist mechanisch und das Auge überspringt sie in einem Dashboard mit vierzig Kennzahlen.
Der zweite ist das Schreiben der Rechnung: einige Zeilen Code, die die deskriptiven Masse, den Standardfehler und das Intervall mit der richtigen Korrektur und der richtigen Verteilung liefern, in Reichweite einer Analystin, die nicht programmiert. Derselbe Code bemisst die Stichprobe vor der Erhebung, eine kurze Rechnung, die wenige Teams anstellen.
Ein Sprachmodell, das man fragt "wie hoch ist der durchschnittliche Warenkorb im Schweizer Detailhandel", liefert eine plausible Zahl, ohne eine Stichprobe gezogen zu haben und ohne ein Intervall anzugeben, weil keine Grundgesamtheit dahintersteht. Die Qualität der Auswahl ist eine Eigenschaft der Organisation, die die Daten erhoben hat. Datensätze enthalten oft Personendaten, deren Weitergabe an einen externen Dienst die Verantwortung des Unternehmens nach dem Bundesgesetz über den Datenschutz auslöst: Die Rechnung läuft auf aggregierten Daten oder in einer kontrollierten Umgebung.
Beispiele
Ein Westschweizer Detailhändler schätzt den durchschnittlichen Warenkorb des vergangenen Quartals, um eine Verkaufsaktion zu bemessen. Das Quartal umfasst 52'000 Transaktionen und die Analyse stützt sich auf 400 davon, zufällig aus dem Verkaufsjournal gezogen.
| Element | Wert | Lesart |
|---|---|---|
| Grundgesamtheit | 52'000 Transaktionen des Quartals | Der gesuchte Parameter ist der Mittelwert dieser Menge |
| Stichprobe | 400 Transaktionen, einfache Zufallsauswahl aus dem Verkaufsjournal | Für jede Transaktion gleiche und bekannte Ziehungswahrscheinlichkeit |
| Mittelwert der Stichprobe | CHF 68.40 | Die Punktschätzung des durchschnittlichen Warenkorbs |
| Median | CHF 54.20 | Jede zweite Transaktion bleibt unter CHF 54.20 |
| Standardabweichung der Stichprobe | CHF 31.20 | Die Streuung der Warenkörbe um ihren Mittelwert |
| Schiefe | +1,4 | Rechtsschiefe Verteilung: Einige grosse Warenkörbe ziehen den Mittelwert über den Median |
| Standardfehler | CHF 1.56 | 31.20 geteilt durch die Wurzel aus 400, also die Streuung der Stichprobenmittelwerte |
| 95%-Konfidenzintervall | CHF 65.34 bis CHF 71.46 | 68.40 zuzüglich und abzüglich des 1,96-Fachen des Standardfehlers |
| Festgehaltene Annahmen | Vollständiger Stichprobenrahmen, keine Gewichtung, Retouren und Stornierungen ausgeschlossen | Was die Schätzung voraussetzt und die Zahl nicht zeigt |
Verteilung der 400 Warenkörbe der Stichprobe
Klassen zu CHF 10
Der Abstand von CHF 14 zwischen Mittelwert und Median rührt von der Schiefe her: Eine auf CHF 68.40 kalibrierte Verkaufsaktion zielt auf einen Warenkorb, den die Mehrheit der Kundschaft nicht erreicht, und der Median ist die Zahl, die für diese Bemessung zählt. Das Intervall wiederum begrenzt, was die Stichprobe über das ganze Quartal zu behaupten erlaubt.
Visualisierungen
Zwei Dinge verlangen eine Zeichnung. Der Übergang von der Grundgesamtheit zu den Stichprobenmittelwerten und von deren Streuung zum Intervall: Die Abfolge ist räumlich, und wer sie einmal sieht, liest das Intervall nicht länger als dekorativen Fehlerbalken. Danach der Abstand zwischen Mittelwert und Median auf einer schiefen Verteilung, den ein Histogramm auf einen Blick zeigt. Die deskriptiven Masse und die Schätzung werden tabellarisch ausgewiesen, mit der Lesart daneben.
Der IIBA-Leitfaden zählt zu den Grenzen der Technik die Schwierigkeit, eine statistische Auswertung ohne Bilder und ohne Erzählung zu vermitteln. Geschäftsvisualisierungen behandeln diesen Punkt. Eine Schätzung wird mit ihrem Intervall gezeichnet. Eine schiefe Verteilung zeigt sich im Histogramm oder im Boxplot.
Aufwand
| Phase | Niveau | Begründung |
|---|---|---|
| Vorbereitung | Mittel | Die Grundgesamtheit zu definieren, einen brauchbaren Stichprobenrahmen zu beschaffen und den Umfang zu bemessen, dauert einige Tage. Die Erhebung selbst sprengt dieses Budget, sobald sie über eine Umfrage läuft. |
| Durchführung | Gering | Die deskriptiven Masse und das Intervall liefern eine Tabellenkalkulation oder fünfzehn Zeilen Code in wenigen Minuten, auf bereits erhobenen Daten. |
| Dokumentation | Mittel | Die Annahmen, das Auswahlverfahren, die Ausfallquote und der Gültigkeitsbereich werden festgehalten, sonst ist die Schätzung weder prüfbar noch im nächsten Quartal wiederholbar. |
Werkzeuge
Die Tabellenkalkulation deckt den gewöhnlichen Bedarf. Excel und LibreOffice Calc berechnen Mittelwert, Median, Quantile, Standardabweichung, Schiefe und Wölbung als eigene Funktionen, und das Add-In Analyse-Funktionen von Excel liefert die deskriptiven Masse in einem Block. Eine Vorsichtsmassnahme: das Intervall von Hand bilden. Das Add-In bietet es als Option an und die Funktionen KONFIDENZ.NORM und KONFIDENZ.T berechnen es, doch keine Mittelwertformel zeigt es von sich aus.
Python und R übernehmen, sobald die Auswertung in jeder Periode zu wiederholen oder zu versionieren ist. Die Bibliotheken pandas, NumPy und SciPy liefern ebenso wie die Basisfunktionen von R die vollständige Zusammenfassung und die Intervalle in wenigen Zeilen, und die Codedatei dokumentiert das Verfahren. Statistiksoftware (SPSS, Stata, jamovi, JASP) dient Teams, die nicht programmieren, und gibt das Intervall aus, ohne dass man danach fragt.
Business-Intelligence-Werkzeuge (Power BI, Tableau, Qlik) berechnen dieselben Masse und bergen das umgekehrte Risiko: Sie zeigen standardmässig einen Mittelwert an, über jede numerische Spalte, ohne nach dem Datentyp zu fragen und ohne ein Intervall auszuweisen. Eine in diesen Werkzeugen definierte Kennzahl ist an Metriken und KPI zu messen. Umfrageplattformen (Qualtrics, LimeSurvey, SurveyMonkey) regeln die Auswahl, die Erinnerungen und die Berechnung der Fehlermarge im Moment der Erhebung, wo sich das Problem lösen lässt.
Quellen
- IIBA, Guide to Business Data Analytics, §3.9 Descriptive and Inferential Statistics: die fachliche Rahmung, die Datentypen, die deskriptiven und die schliessenden Elemente, die Stärken und die Grenzen; der Leitfaden lässt die mathematische Tiefe beiseite und verweist auf die Statistikliteratur.
- NIST/SEMATECH, e-Handbook of Statistical Methods, §1.3.5.1 Measures of Location: Mittelwert, Median und Modus, ihr Zusammenfallen bei symmetrischer Verteilung und die Wahl des Schätzers nach der Form der Daten.
- NIST/SEMATECH, e-Handbook of Statistical Methods, §1.3.5.2 Confidence Limits for the Mean: die Stichprobenverteilung, der Standardfehler, die Bildung des Intervalls und der Hinweis auf seine Auslegung.
- NIST/SEMATECH, e-Handbook of Statistical Methods, §1.3.5.6 Measures of Scale: die Varianz einer Stichprobe, geteilt durch den um eins verminderten Umfang, und die Standardabweichung als deren Wurzel.
- NIST/SEMATECH, e-Handbook of Statistical Methods, §1.3.5.11 Measures of Skewness and Kurtosis: Schiefe und Wölbung als Diagnosen der Form einer Verteilung.
- Jerzy Neyman, Outline of a Theory of Statistical Estimation Based on the Classical Theory of Probability, Philosophical Transactions of the Royal Society of London A, vol. 236, no. 767, 1937, pp. 333-380: die vollständige Theorie des Konfidenzintervalls und des Konfidenzniveaus als Eigenschaft des Verfahrens.
- ISO 3534-1:2006, Statistics - Vocabulary and symbols - Part 1: die normierten Definitionen von Grundgesamtheit, Stichprobe, Parameter, Statistik und Konfidenzintervall.
- Bundesamt für Statistik, Schweizerische Arbeitskräfteerhebung (SAKE): eine vierteljährlich mit ihren Konfidenzintervallen veröffentlichte Stichprobenschätzung.

