Your Training Partner
Toolbox des techniques
Distribution d'échantillonnage en quatre parties. À gauche, la population des transactions d'une enseigne romande en nuage de points, traversée par la ligne de la moyenne de population, étiquetée inconnue et sans chiffre. Au centre, quatre échantillons de quatre cents transactions détourés du nuage, chacun avec sa moyenne. À droite, les quatre moyennes reportées sur un axe en francs, dispersées de part et d'autre de la ligne de population. Sous elles, la bande de l'intervalle de confiance construit sur le premier échantillon, assez large pour couvrir les trois autres. En bas, sur toute la largeur, vingt intervalles empilés: dix-neuf coupent la ligne de la vraie valeur, un la manque.

Statistiques descriptives et inférentielles

Les statistiques descriptives résument un jeu de données en main: où les valeurs se concentrent, de combien elles s'écartent, quelle forme prend leur répartition. Les statistiques inférentielles étendent ce résumé à une population que personne n'a mesurée en entier, à partir d'un échantillon qui en est tiré. Le livrable change de nature: la réponse est une estimation assortie d'un intervalle et d'un niveau de confiance.

Objectif

Les statistiques descriptives et inférentielles sont les mesures qui résument un jeu de données et étendent ce résumé à la population dont ces données sont tirées. La technique intervient lorsqu'une décision demande un chiffre que personne n'a mesuré en totalité. Le panier moyen d'une enseigne, la satisfaction de sa clientèle, la durée de traitement d'un dossier à l'assurance: chacun s'estime sur un échantillon.

Le guide de l'IIBA place la difficulté dans l'interprétation: quantifier les données, puis les lire dans leur contexte métier, avant qu'elles n'alimentent une décision.

Le livrable tient en deux pièces. Les statistiques descriptives donnent une mesure de position, une mesure de dispersion et la forme de la répartition, sur des données dont le type l'autorise. L'estimation donne la valeur cherchée, son intervalle de confiance et les conditions d'échantillonnage qui rendent l'inférence licite.

Usage

Quand l'utiliser

  • Population hors de portée d'un recensement: quelques centaines d'observations tirées au hasard estiment une moyenne à quelques pour cent près; le taux d'adoption, le consentement à payer ou la satisfaction entrent dans un business case avec leur intervalle.
  • Comparaison de deux périodes ou de deux variantes: deux moyennes ne se comparent qu'une fois leur dispersion connue.
  • Indicateur à définir ou à surveiller par échantillonnage: taux de défaut, délai de réponse, volume de réclamations, dont on choisit les mesures de position et de dispersion avant de fixer une cible chiffrée.
  • Ordre de grandeur contesté entre parties prenantes: le calcul ne change pas selon qui le lit, force que le guide de l'IIBA relève.

Quand ne pas l'utiliser

  • Aucune donnée mesurée sur les facteurs qui jouent: un jugement d'experts structuré par la méthode Delphi rend davantage qu'un chiffre faussement précis.
  • Incertitudes multiples combinées par une formule: la simulation décisionnelle propage les plages jusqu'au résultat.

Description

Deux questions distinctes

 Statistiques descriptivesStatistiques inférentielles
QuestionQue disent les données que j'ai sous la main?Que puis-je affirmer de la population que je n'ai pas mesurée?
ObjetLe jeu de données observé, quelle que soit son origineUn échantillon tiré d'une population définie
ConditionsUn type de données compatible avec la mesure calculéeTirage aléatoire, observations indépendantes, taille suffisante
RésultatPosition, dispersion, forme de la répartitionUne estimation, son intervalle et son niveau de confiance
Ce qu'il ne dit pasRien sur ce qui n'a pas été observéRien sur la cause de ce qui est estimé
Les deux moitiés de la technique, ligne à ligne: l'objet, les conditions et le livrable diffèrent. La dernière ligne marque la frontière avec le test d'hypothèses et l'analyse exploratoire des données.

Deux sujets voisins restent hors du périmètre. Décider si un écart observé entre deux groupes tient de l'aléa d'échantillonnage relève de la formulation et du test d'hypothèses, avec son hypothèse nulle, son seuil de signification et sa décision de rejet. Regarder les données brutes avant de les résumer, y chercher les valeurs aberrantes et les trous, relève de l'analyse exploratoire des données. L'intervalle de confiance et le test d'hypothèse lisent pourtant la même distribution d'échantillonnage, si bien qu'une hypothèse plaçant la moyenne hors de l'intervalle à 95% est rejetée par le test bilatéral au seuil de 5%.

Le type de données décide de la mesure

Une donnée continue prend n'importe quelle valeur d'un intervalle: un chiffre d'affaires, une durée. Une donnée discrète se compte par unités entières: un nombre de collaborateurs, un nombre d'articles commandés. Une donnée catégorielle nomme une classe sans ordre: un canton, une gamme de produits. Quand les classes s'ordonnent, la donnée est ordinale: une note scolaire de 1 à 6, une échelle de satisfaction de « très insatisfait » à « très satisfait ».

Le guide de l'IIBA insiste sur la conséquence: traiter une donnée ordinale comme une catégorie efface l'ordre, et une note excellente pèse alors autant qu'une note d'échec. Une moyenne calculée sur une échelle de satisfaction suppose que l'écart entre « insatisfait » et « neutre » vaut celui entre « satisfait » et « très satisfait », ce que rien ne garantit. Une satisfaction moyenne de 3,7 sur cinq échelons, un niveau de risque moyen de 2,4, une priorité moyenne de 1,8: ces nombres peuplent les tableaux de bord et sortent d'un calcul que les données n'autorisent pas.

Où se concentrent les valeurs

La moyenne est la somme des valeurs divisée par leur nombre. La médiane coupe les données en deux moitiés de même effectif. Le mode est la valeur la plus fréquente. Les quantiles découpent la répartition en tranches d'effectif égal, les centiles en centièmes, les quartiles en quarts.

Sur une répartition symétrique en cloche, moyenne, médiane et mode coïncident, relève le NIST, si bien que le choix ne se voit pas. Il se voit dès que la répartition penche. La moyenne suit les valeurs extrêmes, la médiane leur résiste. Le mode se dédouble quand plusieurs valeurs sont également fréquentes, ce qui le rend peu maniable comme résumé unique. La médiane sert aussi de valeur de remplacement des données manquantes, usage que le guide de l'IIBA relève.

De combien elles s'écartent

Deux fonds proposés par la même banque affichent 3,2% de rendement annuel moyen sur dix ans. L'écart-type du premier est de 1,1%, celui du second de 9,4%. La moyenne est identique et les deux placements n'exposent pas au même risque. Le guide de l'IIBA en fait son argument pour les mesures de dispersion.

La variance est la moyenne des écarts au carré par rapport à la moyenne. L'écart-type en est la racine carrée. Les deux portent la même information et une seule se communique: la variance s'exprime en unités au carré, des francs carrés, que le guide signale comme une gêne pour les parties prenantes métier. L'écart-type revient dans l'unité de la moyenne et se rapporte à côté d'elle.

Le coefficient d'asymétrie dit de quel côté la répartition penche; le coefficient d'aplatissement dit le poids de ses queues, donc la fréquence des valeurs extrêmes. Ce sont des diagnostics: ils décident si la moyenne mérite d'être rapportée. Une asymétrie marquée vers la droite, cas ordinaire des montants et des durées, met la moyenne au-dessus de la médiane et au-dessus de ce que la majorité des observations vaut.

Forme ou type de donnéesPositionDispersionPoint de vigilance
Continue, répartition symétriqueMoyenneÉcart-typeLa présence de sous-groupes aux comportements différents, que la paire masque
Continue, répartition asymétrique ou à valeurs extrêmesMédianeÉcart interquartileL'ampleur des extrêmes, que l'écart interquartile ignore par construction
OrdinaleMédianeRépartition par classeL'écart réel entre deux échelons, qui n'est pas mesuré
CatégorielleModeEffectifs par classeAucun ordre entre les classes: ni médiane ni moyenne n'a de sens
Discrète de faible étendueMédiane ou modeÉtendue, effectifsUne moyenne à décimales ne correspond à aucune observation possible
La table de décision que le lecteur emporte: quelle mesure de position et quelle mesure de dispersion sont recevables pour quelle forme ou quel type de données et sur quoi rester vigilant une fois la paire choisie.

Population, échantillon, paramètre, statistique

La norme ISO 3534-1 fixe le vocabulaire de quatre termes que la pratique confond. La population est l'ensemble des unités qui intéressent la question posée: les 52'000 transactions d'un trimestre, les sinistres d'une branche. Le paramètre est la grandeur cherchée sur cette population, sa moyenne par exemple, et il reste inconnu tant que la population n'est pas mesurée en entier. L'échantillon est le sous-ensemble observé. La statistique est la même grandeur calculée sur cet échantillon.

La statistique estime le paramètre sans l'égaler. La distinction commande le calcul: la variance d'un échantillon employée pour estimer celle de la population se divise par l'effectif diminué de un, comme le donne le NIST; le guide de l'IIBA note seulement que les moments autour de la moyenne s'ajustent.

Pourquoi deux échantillons ne donnent jamais le même chiffre

Tirer un deuxième échantillon de la même population donne une autre moyenne. Ces moyennes se répartissent autour du paramètre inconnu selon une loi qui leur est propre, la distribution d'échantillonnage. L'inférence repose entièrement sur elle. Sa dispersion se mesure par l'erreur type, l'écart-type de l'échantillon divisé par la racine carrée de l'effectif.

La précision progresse comme la racine de l'effectif. Quadrupler la taille de l'échantillon divise l'erreur type par deux: passer de 400 à 1'600 observations coûte quatre fois plus pour gagner un facteur deux. La taille de la population n'entre pas dans le calcul: estimer une moyenne sur un canton de 300'000 habitants ou sur la Suisse entière demande, à précision égale, un échantillon de taille comparable.

Population52'000 transactions du trimestremoyenne de populationinconnue
Quatre échantillonsn = 400 par échantillonCHF 68.40CHF 66.10CHF 69.30CHF 67.20
Les moyennes reportéesCHF 6466687072CHF 65.34CHF 71.46

Vingt intervalles construits de la même façon

chaque segment est l'intervalle de confiance d'un nouvel échantillon

19sur 20 contiennent la moyenne de population
1sur 20 la manque
Un échantillon donne une moyenne, quatre échantillons en donnent quatre. L'intervalle de confiance est construit sur cette dispersion: sur vingt intervalles calculés de la même façon, environ dix-neuf contiennent la moyenne de population que personne n'a mesurée.

L'intervalle de confiance

L'intervalle de confiance est un intervalle calculé sur l'échantillon selon une méthode dont on connaît le taux de réussite à long terme; Jerzy Neyman en a donné la théorie complète en 1937. Sa forme courante pour une moyenne est la moyenne de l'échantillon plus ou moins un multiple de l'erreur type, lu dans la loi de Student pour le niveau de confiance et l'effectif. Le niveau usuel est 95%.

Un intervalle de confiance à 95% ne dit pas qu'il y a 95% de chances que la vraie moyenne s'y trouve. L'intervalle calculé sur un échantillon donné contient la vraie valeur ou ne la contient pas. Le niveau de confiance est une propriété de la méthode: si l'on répétait le tirage un grand nombre de fois et que l'on construisait chaque fois l'intervalle de la même façon, environ 95% de ces intervalles contiendraient la moyenne de la population.

Ce qui autorise l'inférence

Trois conditions rendent l'inférence défendable. Le tirage est aléatoire, c'est-à-dire que chaque unité de la population a une probabilité connue et non nulle d'être retenue. Les observations sont indépendantes: quatre réponses recueillies auprès de quatre collaborateurs du même service, après discussion entre eux, ne valent pas quatre observations. La taille est suffisante pour l'écart que la décision doit distinguer, ce qui se calcule avant la collecte.

L'Office fédéral de la statistique applique ces conditions à l'Enquête suisse sur la population active: chaque trimestre, un échantillon tiré d'un registre donne des estimations publiées avec leur intervalle de confiance. Le taux de chômage au sens du BIT en sort. Le taux de chômage du SECO, celui que la presse cite chaque mois, compte les personnes inscrites auprès des offices régionaux de placement et ne repose sur aucun échantillon.

Le guide de l'IIBA place au premier rang de ses limites l'obligation d'identifier et de consigner les hypothèses que la méthode suppose. Écrire à côté du chiffre: la population, la base de sondage, le mode de tirage, l'effectif, le taux de non-réponse et ce qui distingue peut-être les non-répondants. Une estimation livrée sans ces lignes n'est pas auditable.

L'espérance, quand le résultat est incertain par nature

Quand l'issue est incertaine, l'espérance est la moyenne des valeurs possibles pondérée par leur probabilité. Un assureur qui attend des sinistres automobiles de CHF 2'000, CHF 1'500 et CHF 1'000 avec des probabilités de 0,5, 0,3 et 0,2 anticipe une charge de CHF 1'650 par police. Aucun sinistre ne vaudra ce montant; c'est pourtant lui qui sert à tarifer.

Le guide de l'IIBA signale ici une erreur de cadrage: optimiser la mauvaise grandeur. L'organisation qui vise un taux de départ plus bas optimise une probabilité, quand son résultat dépend de l'espérance des affaires perdues, où le départ du responsable d'un grand compte ne pèse pas comme celui d'un poste sans effet client.

Deux variables prises ensemble

La covariance et la corrélation mesurent la façon dont deux variables varient de concert, la seconde étant une version normalisée de la première, bornée entre -1 et 1. Une corrélation forte signale une relation à examiner, sans dire le sens de la causalité ni l'existence d'un troisième facteur qui expliquerait les deux. Modéliser cette relation pour prédire une variable à partir de l'autre relève de la régression.

Les pièges

L'intervalle lu comme une probabilité

Le comité retient « il y a 95% de chances que le panier moyen soit entre 65 et 71 francs »: la phrase se paie au trimestre suivant, quand le même calcul rend un autre intervalle.

Le grand échantillon biaisé

Un effectif élevé resserre l'intervalle sans rien corriger d'un tirage vicié. Cinquante mille réponses volontaires à un questionnaire en ligne estiment la satisfaction des gens qui répondent aux questionnaires en ligne, avec une précision remarquable et un biais que rien dans le calcul ne signale. Quatre cents personnes tirées au hasard dans la base clients valent mieux: l'intervalle décrit l'erreur d'échantillonnage seule.

Le chiffre unique qui survit à son intervalle

L'estimation part de l'analyse avec son intervalle et arrive au comité sans lui, parce qu'une diapositive tient mieux un nombre qu'une fourchette. Le remède: écrire la borne basse et la borne haute dans la même cellule que l'estimation, dès la feuille de calcul, pour qu'aucune copie ne puisse les séparer.

Considérations IA

Le premier emploi utile est le choix de la mesure: un modèle de langue à qui l'on décrit la structure du jeu de données, le type de chaque colonne et la question posée propose les mesures de position et de dispersion recevables et signale la colonne ordinale sur laquelle une moyenne se calcule. Le contrôle est mécanique et l'œil le saute dans un tableau de bord de quarante indicateurs.

Le second est l'écriture du calcul: quelques lignes de code qui produisent les statistiques descriptives, l'erreur type et l'intervalle avec la correction et la loi correctes, à portée d'un analyste qui ne programme pas. Le même code dimensionne l'échantillon avant la collecte, calcul court que peu d'équipes font.

Un modèle de langue interrogé sur « quel est le panier moyen dans le commerce de détail suisse » produit un nombre plausible sans avoir tiré d'échantillon et sans donner d'intervalle, faute de population derrière lui. La qualité du tirage est une propriété de l'organisation qui a collecté les données. Les jeux de données contiennent souvent des données personnelles dont la transmission à un service externe engage la responsabilité de l'entreprise sous la loi fédérale sur la protection des données: le calcul se fait sur des agrégats ou dans un périmètre maîtrisé.

Exemples

Une enseigne romande de commerce de détail estime le panier moyen du trimestre écoulé pour dimensionner une action promotionnelle. Le trimestre compte 52'000 transactions et l'analyse porte sur 400 d'entre elles, tirées au hasard dans le journal des ventes.

ÉlémentValeurLecture
Population52'000 transactions du trimestreLe paramètre cherché est la moyenne de cet ensemble
Échantillon400 transactions, tirage aléatoire simple dans le journal des ventesProbabilité de tirage égale et connue pour chaque transaction
Moyenne de l'échantillonCHF 68.40L'estimation ponctuelle du panier moyen
MédianeCHF 54.20Une transaction sur deux reste en dessous de CHF 54.20
Écart-type de l'échantillonCHF 31.20La dispersion des paniers autour de leur moyenne
Coefficient d'asymétrie+1,4Répartition penchée à droite: quelques gros paniers tirent la moyenne au-dessus de la médiane
Erreur typeCHF 1.5631.20 divisé par la racine de 400, soit la dispersion des moyennes d'échantillon
Intervalle de confiance à 95%CHF 65.34 à CHF 71.4668.40 plus ou moins 1,96 fois l'erreur type
Hypothèses consignéesBase de sondage complète, aucune pondération, retours et annulations exclusCe que l'estimation suppose et que le nombre ne montre pas
Le livrable complet, sur l'exemple de l'enseigne romande. L'estimation ponctuelle, CHF 68.40, n'est qu'une ligne sur neuf: l'intervalle, les mesures descriptives et les hypothèses consignées font partie du résultat.

Répartition des 400 paniers de l'échantillon

classes de CHF 10

médiane CHF 54.20 moyenne CHF 68.40
0306090120150150+Nombre de paniers
Les 400 paniers de l'échantillon, en classes de CHF 10. La répartition penche à droite: quelques gros paniers tirent la moyenne à CHF 68.40, au-dessus de la médiane à CHF 54.20, qu'une transaction sur deux n'atteint pas.

L'écart de CHF 14 entre la moyenne et la médiane vient de l'asymétrie: une action promotionnelle calibrée sur CHF 68.40 vise un panier que la majorité des clients n'atteint pas, et la médiane est le chiffre à retenir pour ce dimensionnement. L'intervalle, lui, borne ce que l'échantillon autorise à affirmer sur le trimestre entier.

Visualisations

Deux choses demandent un dessin. Le passage de la population aux moyennes d'échantillon, puis de leur dispersion à l'intervalle: la suite est spatiale et un lecteur qui la voit une fois cesse de lire l'intervalle comme une barre d'erreur décorative. Puis l'écart entre moyenne et médiane sur une répartition penchée, qu'un histogramme montre d'un coup. Les statistiques descriptives et l'estimation se rapportent en tableau, avec leur lecture en regard.

Le guide de l'IIBA compte parmi les limites de la technique la difficulté à communiquer une analyse statistique sans visuels ni récits. Les visualisations métier traitent ce point. Une estimation se dessine avec son intervalle. Une répartition asymétrique se montre en histogramme ou en boîte à moustaches.

Coût

PhaseNiveauJustification
PréparationMoyenDéfinir la population, obtenir une base de sondage utilisable et dimensionner l'échantillon demande quelques jours. La collecte elle-même, quand elle passe par un sondage, dépasse ce budget.
ExécutionFaibleLes statistiques descriptives et l'intervalle sortent en quelques minutes d'un tableur ou de quinze lignes de code, sur des données déjà collectées.
DocumentationMoyenLes hypothèses, le mode de tirage, le taux de non-réponse et le domaine de validité se consignent, faute de quoi l'estimation n'est ni auditable ni reproductible au trimestre suivant.

Outils

Le tableur couvre le besoin courant. Excel et LibreOffice Calc calculent moyenne, médiane, quantiles, écart-type et coefficients de forme en fonctions natives, et l'utilitaire d'analyse d'Excel ajoute les statistiques descriptives en un bloc. Une précaution: construire l'intervalle à la main. L'utilitaire d'analyse le propose en option et les fonctions CONFIANCE.NORMAL et CONFIANCE.STUDENT le calculent, mais aucune formule de moyenne ne l'affiche d'elle-même.

Python et R prennent le relais dès que l'analyse doit être rejouée à chaque période ou versionnée. Les bibliothèques pandas, NumPy et SciPy, comme les fonctions de base de R, rendent le résumé complet et les intervalles en quelques lignes, et le fichier de code documente la méthode. Les logiciels statistiques (SPSS, Stata, jamovi, JASP) servent les équipes qui ne programment pas et rendent l'intervalle sans qu'on le demande.

Les outils décisionnels (Power BI, Tableau, Qlik) calculent les mêmes mesures et posent le risque opposé: ils affichent une moyenne par défaut, sur n'importe quelle colonne numérique, sans poser la question du type de données ni afficher d'intervalle. Un indicateur défini dans ces outils gagne à être revu à l'aune des métriques et KPI. Les plateformes de sondage (Qualtrics, LimeSurvey, SurveyMonkey) gèrent le tirage, les relances et le calcul de la marge d'erreur au moment de la collecte, où le problème se règle.

Sources

Spikes
Toutes les techniques
Story Mapping