Statistiques descriptives et inférentielles
Les statistiques descriptives résument un jeu de données en main: où les valeurs se concentrent, de combien elles s'écartent, quelle forme prend leur répartition. Les statistiques inférentielles étendent ce résumé à une population que personne n'a mesurée en entier, à partir d'un échantillon qui en est tiré. Le livrable change de nature: la réponse est une estimation assortie d'un intervalle et d'un niveau de confiance.
Objectif
Les statistiques descriptives et inférentielles sont les mesures qui résument un jeu de données et étendent ce résumé à la population dont ces données sont tirées. La technique intervient lorsqu'une décision demande un chiffre que personne n'a mesuré en totalité. Le panier moyen d'une enseigne, la satisfaction de sa clientèle, la durée de traitement d'un dossier à l'assurance: chacun s'estime sur un échantillon.
Le guide de l'IIBA place la difficulté dans l'interprétation: quantifier les données, puis les lire dans leur contexte métier, avant qu'elles n'alimentent une décision.
Le livrable tient en deux pièces. Les statistiques descriptives donnent une mesure de position, une mesure de dispersion et la forme de la répartition, sur des données dont le type l'autorise. L'estimation donne la valeur cherchée, son intervalle de confiance et les conditions d'échantillonnage qui rendent l'inférence licite.
Usage
Quand l'utiliser
- Population hors de portée d'un recensement: quelques centaines d'observations tirées au hasard estiment une moyenne à quelques pour cent près; le taux d'adoption, le consentement à payer ou la satisfaction entrent dans un business case avec leur intervalle.
- Comparaison de deux périodes ou de deux variantes: deux moyennes ne se comparent qu'une fois leur dispersion connue.
- Indicateur à définir ou à surveiller par échantillonnage: taux de défaut, délai de réponse, volume de réclamations, dont on choisit les mesures de position et de dispersion avant de fixer une cible chiffrée.
- Ordre de grandeur contesté entre parties prenantes: le calcul ne change pas selon qui le lit, force que le guide de l'IIBA relève.
Quand ne pas l'utiliser
- Aucune donnée mesurée sur les facteurs qui jouent: un jugement d'experts structuré par la méthode Delphi rend davantage qu'un chiffre faussement précis.
- Incertitudes multiples combinées par une formule: la simulation décisionnelle propage les plages jusqu'au résultat.
Description
Deux questions distinctes
| Statistiques descriptives | Statistiques inférentielles | |
|---|---|---|
| Question | Que disent les données que j'ai sous la main? | Que puis-je affirmer de la population que je n'ai pas mesurée? |
| Objet | Le jeu de données observé, quelle que soit son origine | Un échantillon tiré d'une population définie |
| Conditions | Un type de données compatible avec la mesure calculée | Tirage aléatoire, observations indépendantes, taille suffisante |
| Résultat | Position, dispersion, forme de la répartition | Une estimation, son intervalle et son niveau de confiance |
| Ce qu'il ne dit pas | Rien sur ce qui n'a pas été observé | Rien sur la cause de ce qui est estimé |
Deux sujets voisins restent hors du périmètre. Décider si un écart observé entre deux groupes tient de l'aléa d'échantillonnage relève de la formulation et du test d'hypothèses, avec son hypothèse nulle, son seuil de signification et sa décision de rejet. Regarder les données brutes avant de les résumer, y chercher les valeurs aberrantes et les trous, relève de l'analyse exploratoire des données. L'intervalle de confiance et le test d'hypothèse lisent pourtant la même distribution d'échantillonnage, si bien qu'une hypothèse plaçant la moyenne hors de l'intervalle à 95% est rejetée par le test bilatéral au seuil de 5%.
Le type de données décide de la mesure
Une donnée continue prend n'importe quelle valeur d'un intervalle: un chiffre d'affaires, une durée. Une donnée discrète se compte par unités entières: un nombre de collaborateurs, un nombre d'articles commandés. Une donnée catégorielle nomme une classe sans ordre: un canton, une gamme de produits. Quand les classes s'ordonnent, la donnée est ordinale: une note scolaire de 1 à 6, une échelle de satisfaction de « très insatisfait » à « très satisfait ».
Le guide de l'IIBA insiste sur la conséquence: traiter une donnée ordinale comme une catégorie efface l'ordre, et une note excellente pèse alors autant qu'une note d'échec. Une moyenne calculée sur une échelle de satisfaction suppose que l'écart entre « insatisfait » et « neutre » vaut celui entre « satisfait » et « très satisfait », ce que rien ne garantit. Une satisfaction moyenne de 3,7 sur cinq échelons, un niveau de risque moyen de 2,4, une priorité moyenne de 1,8: ces nombres peuplent les tableaux de bord et sortent d'un calcul que les données n'autorisent pas.
Où se concentrent les valeurs
La moyenne est la somme des valeurs divisée par leur nombre. La médiane coupe les données en deux moitiés de même effectif. Le mode est la valeur la plus fréquente. Les quantiles découpent la répartition en tranches d'effectif égal, les centiles en centièmes, les quartiles en quarts.
Sur une répartition symétrique en cloche, moyenne, médiane et mode coïncident, relève le NIST, si bien que le choix ne se voit pas. Il se voit dès que la répartition penche. La moyenne suit les valeurs extrêmes, la médiane leur résiste. Le mode se dédouble quand plusieurs valeurs sont également fréquentes, ce qui le rend peu maniable comme résumé unique. La médiane sert aussi de valeur de remplacement des données manquantes, usage que le guide de l'IIBA relève.
De combien elles s'écartent
Deux fonds proposés par la même banque affichent 3,2% de rendement annuel moyen sur dix ans. L'écart-type du premier est de 1,1%, celui du second de 9,4%. La moyenne est identique et les deux placements n'exposent pas au même risque. Le guide de l'IIBA en fait son argument pour les mesures de dispersion.
La variance est la moyenne des écarts au carré par rapport à la moyenne. L'écart-type en est la racine carrée. Les deux portent la même information et une seule se communique: la variance s'exprime en unités au carré, des francs carrés, que le guide signale comme une gêne pour les parties prenantes métier. L'écart-type revient dans l'unité de la moyenne et se rapporte à côté d'elle.
Le coefficient d'asymétrie dit de quel côté la répartition penche; le coefficient d'aplatissement dit le poids de ses queues, donc la fréquence des valeurs extrêmes. Ce sont des diagnostics: ils décident si la moyenne mérite d'être rapportée. Une asymétrie marquée vers la droite, cas ordinaire des montants et des durées, met la moyenne au-dessus de la médiane et au-dessus de ce que la majorité des observations vaut.
| Forme ou type de données | Position | Dispersion | Point de vigilance |
|---|---|---|---|
| Continue, répartition symétrique | Moyenne | Écart-type | La présence de sous-groupes aux comportements différents, que la paire masque |
| Continue, répartition asymétrique ou à valeurs extrêmes | Médiane | Écart interquartile | L'ampleur des extrêmes, que l'écart interquartile ignore par construction |
| Ordinale | Médiane | Répartition par classe | L'écart réel entre deux échelons, qui n'est pas mesuré |
| Catégorielle | Mode | Effectifs par classe | Aucun ordre entre les classes: ni médiane ni moyenne n'a de sens |
| Discrète de faible étendue | Médiane ou mode | Étendue, effectifs | Une moyenne à décimales ne correspond à aucune observation possible |
Population, échantillon, paramètre, statistique
La norme ISO 3534-1 fixe le vocabulaire de quatre termes que la pratique confond. La population est l'ensemble des unités qui intéressent la question posée: les 52'000 transactions d'un trimestre, les sinistres d'une branche. Le paramètre est la grandeur cherchée sur cette population, sa moyenne par exemple, et il reste inconnu tant que la population n'est pas mesurée en entier. L'échantillon est le sous-ensemble observé. La statistique est la même grandeur calculée sur cet échantillon.
La statistique estime le paramètre sans l'égaler. La distinction commande le calcul: la variance d'un échantillon employée pour estimer celle de la population se divise par l'effectif diminué de un, comme le donne le NIST; le guide de l'IIBA note seulement que les moments autour de la moyenne s'ajustent.
Pourquoi deux échantillons ne donnent jamais le même chiffre
Tirer un deuxième échantillon de la même population donne une autre moyenne. Ces moyennes se répartissent autour du paramètre inconnu selon une loi qui leur est propre, la distribution d'échantillonnage. L'inférence repose entièrement sur elle. Sa dispersion se mesure par l'erreur type, l'écart-type de l'échantillon divisé par la racine carrée de l'effectif.
La précision progresse comme la racine de l'effectif. Quadrupler la taille de l'échantillon divise l'erreur type par deux: passer de 400 à 1'600 observations coûte quatre fois plus pour gagner un facteur deux. La taille de la population n'entre pas dans le calcul: estimer une moyenne sur un canton de 300'000 habitants ou sur la Suisse entière demande, à précision égale, un échantillon de taille comparable.
Vingt intervalles construits de la même façon
chaque segment est l'intervalle de confiance d'un nouvel échantillon
L'intervalle de confiance
L'intervalle de confiance est un intervalle calculé sur l'échantillon selon une méthode dont on connaît le taux de réussite à long terme; Jerzy Neyman en a donné la théorie complète en 1937. Sa forme courante pour une moyenne est la moyenne de l'échantillon plus ou moins un multiple de l'erreur type, lu dans la loi de Student pour le niveau de confiance et l'effectif. Le niveau usuel est 95%.
Un intervalle de confiance à 95% ne dit pas qu'il y a 95% de chances que la vraie moyenne s'y trouve. L'intervalle calculé sur un échantillon donné contient la vraie valeur ou ne la contient pas. Le niveau de confiance est une propriété de la méthode: si l'on répétait le tirage un grand nombre de fois et que l'on construisait chaque fois l'intervalle de la même façon, environ 95% de ces intervalles contiendraient la moyenne de la population.
Ce qui autorise l'inférence
Trois conditions rendent l'inférence défendable. Le tirage est aléatoire, c'est-à-dire que chaque unité de la population a une probabilité connue et non nulle d'être retenue. Les observations sont indépendantes: quatre réponses recueillies auprès de quatre collaborateurs du même service, après discussion entre eux, ne valent pas quatre observations. La taille est suffisante pour l'écart que la décision doit distinguer, ce qui se calcule avant la collecte.
L'Office fédéral de la statistique applique ces conditions à l'Enquête suisse sur la population active: chaque trimestre, un échantillon tiré d'un registre donne des estimations publiées avec leur intervalle de confiance. Le taux de chômage au sens du BIT en sort. Le taux de chômage du SECO, celui que la presse cite chaque mois, compte les personnes inscrites auprès des offices régionaux de placement et ne repose sur aucun échantillon.
Le guide de l'IIBA place au premier rang de ses limites l'obligation d'identifier et de consigner les hypothèses que la méthode suppose. Écrire à côté du chiffre: la population, la base de sondage, le mode de tirage, l'effectif, le taux de non-réponse et ce qui distingue peut-être les non-répondants. Une estimation livrée sans ces lignes n'est pas auditable.
L'espérance, quand le résultat est incertain par nature
Quand l'issue est incertaine, l'espérance est la moyenne des valeurs possibles pondérée par leur probabilité. Un assureur qui attend des sinistres automobiles de CHF 2'000, CHF 1'500 et CHF 1'000 avec des probabilités de 0,5, 0,3 et 0,2 anticipe une charge de CHF 1'650 par police. Aucun sinistre ne vaudra ce montant; c'est pourtant lui qui sert à tarifer.
Le guide de l'IIBA signale ici une erreur de cadrage: optimiser la mauvaise grandeur. L'organisation qui vise un taux de départ plus bas optimise une probabilité, quand son résultat dépend de l'espérance des affaires perdues, où le départ du responsable d'un grand compte ne pèse pas comme celui d'un poste sans effet client.
Deux variables prises ensemble
La covariance et la corrélation mesurent la façon dont deux variables varient de concert, la seconde étant une version normalisée de la première, bornée entre -1 et 1. Une corrélation forte signale une relation à examiner, sans dire le sens de la causalité ni l'existence d'un troisième facteur qui expliquerait les deux. Modéliser cette relation pour prédire une variable à partir de l'autre relève de la régression.
Les pièges
L'intervalle lu comme une probabilité
Le comité retient « il y a 95% de chances que le panier moyen soit entre 65 et 71 francs »: la phrase se paie au trimestre suivant, quand le même calcul rend un autre intervalle.
Le grand échantillon biaisé
Un effectif élevé resserre l'intervalle sans rien corriger d'un tirage vicié. Cinquante mille réponses volontaires à un questionnaire en ligne estiment la satisfaction des gens qui répondent aux questionnaires en ligne, avec une précision remarquable et un biais que rien dans le calcul ne signale. Quatre cents personnes tirées au hasard dans la base clients valent mieux: l'intervalle décrit l'erreur d'échantillonnage seule.
Le chiffre unique qui survit à son intervalle
L'estimation part de l'analyse avec son intervalle et arrive au comité sans lui, parce qu'une diapositive tient mieux un nombre qu'une fourchette. Le remède: écrire la borne basse et la borne haute dans la même cellule que l'estimation, dès la feuille de calcul, pour qu'aucune copie ne puisse les séparer.
Considérations IA
Le premier emploi utile est le choix de la mesure: un modèle de langue à qui l'on décrit la structure du jeu de données, le type de chaque colonne et la question posée propose les mesures de position et de dispersion recevables et signale la colonne ordinale sur laquelle une moyenne se calcule. Le contrôle est mécanique et l'œil le saute dans un tableau de bord de quarante indicateurs.
Le second est l'écriture du calcul: quelques lignes de code qui produisent les statistiques descriptives, l'erreur type et l'intervalle avec la correction et la loi correctes, à portée d'un analyste qui ne programme pas. Le même code dimensionne l'échantillon avant la collecte, calcul court que peu d'équipes font.
Un modèle de langue interrogé sur « quel est le panier moyen dans le commerce de détail suisse » produit un nombre plausible sans avoir tiré d'échantillon et sans donner d'intervalle, faute de population derrière lui. La qualité du tirage est une propriété de l'organisation qui a collecté les données. Les jeux de données contiennent souvent des données personnelles dont la transmission à un service externe engage la responsabilité de l'entreprise sous la loi fédérale sur la protection des données: le calcul se fait sur des agrégats ou dans un périmètre maîtrisé.
Exemples
Une enseigne romande de commerce de détail estime le panier moyen du trimestre écoulé pour dimensionner une action promotionnelle. Le trimestre compte 52'000 transactions et l'analyse porte sur 400 d'entre elles, tirées au hasard dans le journal des ventes.
| Élément | Valeur | Lecture |
|---|---|---|
| Population | 52'000 transactions du trimestre | Le paramètre cherché est la moyenne de cet ensemble |
| Échantillon | 400 transactions, tirage aléatoire simple dans le journal des ventes | Probabilité de tirage égale et connue pour chaque transaction |
| Moyenne de l'échantillon | CHF 68.40 | L'estimation ponctuelle du panier moyen |
| Médiane | CHF 54.20 | Une transaction sur deux reste en dessous de CHF 54.20 |
| Écart-type de l'échantillon | CHF 31.20 | La dispersion des paniers autour de leur moyenne |
| Coefficient d'asymétrie | +1,4 | Répartition penchée à droite: quelques gros paniers tirent la moyenne au-dessus de la médiane |
| Erreur type | CHF 1.56 | 31.20 divisé par la racine de 400, soit la dispersion des moyennes d'échantillon |
| Intervalle de confiance à 95% | CHF 65.34 à CHF 71.46 | 68.40 plus ou moins 1,96 fois l'erreur type |
| Hypothèses consignées | Base de sondage complète, aucune pondération, retours et annulations exclus | Ce que l'estimation suppose et que le nombre ne montre pas |
Répartition des 400 paniers de l'échantillon
classes de CHF 10
L'écart de CHF 14 entre la moyenne et la médiane vient de l'asymétrie: une action promotionnelle calibrée sur CHF 68.40 vise un panier que la majorité des clients n'atteint pas, et la médiane est le chiffre à retenir pour ce dimensionnement. L'intervalle, lui, borne ce que l'échantillon autorise à affirmer sur le trimestre entier.
Visualisations
Deux choses demandent un dessin. Le passage de la population aux moyennes d'échantillon, puis de leur dispersion à l'intervalle: la suite est spatiale et un lecteur qui la voit une fois cesse de lire l'intervalle comme une barre d'erreur décorative. Puis l'écart entre moyenne et médiane sur une répartition penchée, qu'un histogramme montre d'un coup. Les statistiques descriptives et l'estimation se rapportent en tableau, avec leur lecture en regard.
Le guide de l'IIBA compte parmi les limites de la technique la difficulté à communiquer une analyse statistique sans visuels ni récits. Les visualisations métier traitent ce point. Une estimation se dessine avec son intervalle. Une répartition asymétrique se montre en histogramme ou en boîte à moustaches.
Coût
| Phase | Niveau | Justification |
|---|---|---|
| Préparation | Moyen | Définir la population, obtenir une base de sondage utilisable et dimensionner l'échantillon demande quelques jours. La collecte elle-même, quand elle passe par un sondage, dépasse ce budget. |
| Exécution | Faible | Les statistiques descriptives et l'intervalle sortent en quelques minutes d'un tableur ou de quinze lignes de code, sur des données déjà collectées. |
| Documentation | Moyen | Les hypothèses, le mode de tirage, le taux de non-réponse et le domaine de validité se consignent, faute de quoi l'estimation n'est ni auditable ni reproductible au trimestre suivant. |
Outils
Le tableur couvre le besoin courant. Excel et LibreOffice Calc calculent moyenne, médiane, quantiles, écart-type et coefficients de forme en fonctions natives, et l'utilitaire d'analyse d'Excel ajoute les statistiques descriptives en un bloc. Une précaution: construire l'intervalle à la main. L'utilitaire d'analyse le propose en option et les fonctions CONFIANCE.NORMAL et CONFIANCE.STUDENT le calculent, mais aucune formule de moyenne ne l'affiche d'elle-même.
Python et R prennent le relais dès que l'analyse doit être rejouée à chaque période ou versionnée. Les bibliothèques pandas, NumPy et SciPy, comme les fonctions de base de R, rendent le résumé complet et les intervalles en quelques lignes, et le fichier de code documente la méthode. Les logiciels statistiques (SPSS, Stata, jamovi, JASP) servent les équipes qui ne programment pas et rendent l'intervalle sans qu'on le demande.
Les outils décisionnels (Power BI, Tableau, Qlik) calculent les mêmes mesures et posent le risque opposé: ils affichent une moyenne par défaut, sur n'importe quelle colonne numérique, sans poser la question du type de données ni afficher d'intervalle. Un indicateur défini dans ces outils gagne à être revu à l'aune des métriques et KPI. Les plateformes de sondage (Qualtrics, LimeSurvey, SurveyMonkey) gèrent le tirage, les relances et le calcul de la marge d'erreur au moment de la collecte, où le problème se règle.
Sources
- IIBA, Guide to Business Data Analytics, §3.9 Descriptive and Inferential Statistics: le cadrage métier, les types de données, les éléments descriptifs et inférentiels, les forces et les limites; le guide écarte la complexité mathématique et renvoie aux ouvrages de statistique.
- NIST/SEMATECH, e-Handbook of Statistical Methods, §1.3.5.1 Measures of Location: moyenne, médiane et mode, leur coïncidence sur une répartition symétrique et le choix de l'estimateur selon la forme des données.
- NIST/SEMATECH, e-Handbook of Statistical Methods, §1.3.5.2 Confidence Limits for the Mean: la distribution d'échantillonnage, l'erreur type, la construction de l'intervalle et l'avertissement sur son interprétation.
- NIST/SEMATECH, e-Handbook of Statistical Methods, §1.3.5.6 Measures of Scale: la variance d'un échantillon, divisée par l'effectif diminué de un, et l'écart-type qui en est la racine.
- NIST/SEMATECH, e-Handbook of Statistical Methods, §1.3.5.11 Measures of Skewness and Kurtosis: les coefficients d'asymétrie et d'aplatissement comme diagnostics de la forme d'une répartition.
- Jerzy Neyman, Outline of a Theory of Statistical Estimation Based on the Classical Theory of Probability, Philosophical Transactions of the Royal Society of London A, vol. 236, no. 767, 1937, pp. 333-380: la théorie complète de l'intervalle de confiance et du niveau de confiance comme propriété de la méthode.
- ISO 3534-1:2006, Statistique - Vocabulaire et symboles - Partie 1: les définitions normalisées de population, échantillon, paramètre, statistique et intervalle de confiance.
- Office fédéral de la statistique, Enquête suisse sur la population active (ESPA): une estimation par échantillon publiée trimestriellement avec ses intervalles de confiance.

