Your Training Partner
Toolbox des techniques
La séquence du test d'hypothèses, les sept temps du guide regroupés en cinq boîtes, coupée par une barrière verticale: à gauche, ce qui est arrêté avant la collecte des données; à droite, ce qui est calculé après.

Formulation et test d'hypothèses

Le test d'hypothèses est la procédure qui confronte un énoncé chiffré sur une population à un échantillon de données et qui dit si cet échantillon est assez improbable, l'énoncé supposé vrai, pour le rejeter. On écrit deux propositions qui s'excluent, l'hypothèse nulle qui suppose l'absence d'effet et l'hypothèse alternative qui porte la conviction à vérifier. On arrête ensuite, avant de regarder les données, le seuil d'improbabilité à partir duquel la nulle tombera. Le guide de l'IIBA situe la technique dans l'analyse du problème et place la compétence de l'analyste dans la formulation de l'énoncé et dans la lecture du résultat, le calcul revenant à l'équipe de données.

Objectif

Le test d'hypothèses tranche une affirmation métier que personne n'a vérifiée: le taux de réclamation a baissé, cette variante coûte moins cher. Il transforme l'affirmation en un énoncé que des données peuvent démentir, puis il le confronte à un échantillon selon une règle arrêtée d'avance. Le guide de l'IIBA lui assigne cette fonction: convertir une appréciation intuitive en appréciation vérifiable et mesurable, pour éviter les décisions prises au seul jugé.

Le livrable tient en deux pièces. Un protocole écrit avant la collecte, qui porte les deux hypothèses, la variable mesurée, la statistique de test retenue, la taille de l'échantillon, le seuil de signification et la règle de décision. Une note de résultat, qui donne la valeur observée, la statistique calculée, la décision de rejeter ou de conserver l'hypothèse nulle et l'intervalle de confiance.

La technique se place en aval de l'analyse exploratoire des données, qui fait apparaître la régularité candidate, et elle s'appuie sur les statistiques descriptives et inférentielles pour l'échantillonnage, l'estimation et l'intervalle. Elle ajoute une règle de décision fixée avant les données.

Usage

Quand l'utiliser

  • Conviction d'expérience à coût élevé: un responsable affirme un écart que rien n'a mesuré et la décision engage un budget.
  • Décision fondée sur un échantillon: sondage, pilote ou panel dont on veut savoir s'il vaut pour toute la population.
  • Comparaison de deux groupes ou de deux périodes: avant et après, canton contre canton, où l'écart observé peut n'être que du bruit.
  • Résultat destiné à être contesté: régulateur, comité d'audit, partenaire; le protocole antérieur à la collecte rend la conclusion défendable.

Quand ne pas l'utiliser

  • Population entière disponible: les statistiques descriptives donnent l'écart sans test.
  • Question de cause: le test qualifie un écart sans l'expliquer, une expérience randomisée comme le test A/B établit le lien.
  • Aucune hypothèse candidate: rien à réfuter encore, l'analyse exploratoire des données fournit la piste.

Description

Deux énoncés qui s'excluent

L'hypothèse nulle, notée H0, est la position par défaut: l'absence d'effet, l'égalité au chiffre de référence. L'hypothèse alternative, notée H1, en est la négation et porte la conviction à vérifier. Le test interroge une seule des deux: il mesure à quel point les données observées seraient improbables si H0 était vraie. Il rejette H0 quand cette improbabilité franchit un seuil arrêté d'avance.

Le sens de H1 commande la forme du test. Un test bilatéral retient tout écart au chiffre de référence dans les deux directions et répartit le risque entre les deux extrémités de la distribution. Un test unilatéral ne retient qu'une direction et concentre le risque d'un seul côté, ce qui le rend plus apte à détecter un écart dans cette direction. La direction sort de la question métier et se choisit avant la collecte: passer d'un test bilatéral à un test unilatéral une fois le signe de l'écart connu revient à doubler le risque annoncé.

Le seuil se fixe avant de regarder les données

Le seuil de signification, noté α, est le risque de rejeter une hypothèse nulle vraie. Le NIST le définit comme une valeur que celui qui conduit le test fixe lui-même, à l'avance. Les usages professionnels retiennent 5%, parfois 1% quand la conséquence d'un rejet à tort est lourde. La règle de décision traduit ce seuil en une comparaison mécanique: rejeter H0 si la statistique de test tombe au-delà de la valeur critique, du côté que H1 désigne.

Une fois les données sous les yeux, n'importe quel seuil se justifie après coup et la période d'observation se raccourcit jusqu'à ce que l'écart apparaisse. Le protocole écrit et daté avant la collecte est ce qui distingue un résultat d'une mise en scène.

Les deux erreurs et ce qu'elles coûtent

Décision priseH0 est vraie (aucun effet)H0 est fausse (effet réel)
Rejeter H0Erreur de première espèce, de probabilité α: on agit sur un effet qui n'existe pasDécision correcte
Conserver H0Décision correcteErreur de deuxième espèce, de probabilité β: on laisse passer un effet réel

Les deux risques ne se pilotent pas de la même façon. α se fixe librement, puisqu'il est le seuil lui-même. β dépend de l'écart réel entre la population et l'hypothèse nulle, que personne ne connaît, mais aussi de la taille de l'échantillon, de la dispersion et de α. On l'abaisse en augmentant l'échantillon ou en ne cherchant à détecter qu'un écart plus grand. 1 − β s'appelle la puissance du test, la probabilité de détecter un effet qui existe.

Le réglage de α est une décision métier. Quand agir à tort est cher et difficile à défaire, un déploiement national, une renégociation de contrat, on abaisse α. Quand manquer un effet réel coûte davantage, un gisement d'économies laissé de côté année après année, on tient α à 5% et on paie de l'échantillon supplémentaire pour gagner en puissance. Chiffrer les deux erreurs en francs avant de lancer le test permet de débattre de ce choix en séance.

La marche à suivre

Le guide de l'IIBA découpe le déroulement en sept temps.

Énoncer l'hypothèse. « Le programme réduit les coûts » ne se teste pas. « Le coût annuel moyen des prestations des membres inscrits au programme est inférieur à CHF 4'800 » se teste, parce que la variable, la population et le chiffre de référence y sont nommés. H0 reçoit l'absence d'effet, H1 la direction attendue.

Choisir la statistique de test. Le choix suit la forme de la donnée: comparaison d'une moyenne à une référence, de deux proportions, de variances, répartition d'effectifs entre catégories. Les familles usuelles portent les noms de test t, test z, test F et test du khi-deux. L'équipe de données arbitre; l'analyste énonce les conditions que ce choix suppose et vérifie que les données les respectent. Le guide relève qu'une hypothèse correctement formulée n'oblige pas la variable sous-jacente à suivre une loi normale.

Fixer le seuil de signification. Au même moment se décide la taille de l'échantillon, à partir du plus petit écart qui mériterait une action. Un échantillon dimensionné après coup est un échantillon dimensionné par le résultat souhaité.

Écrire la règle de décision. Elle nomme la valeur critique et le côté de la distribution que H1 désigne.

Collecter l'échantillon et calculer. Le mode de tirage pèse plus lourd que l'arithmétique. Le guide compte parmi ses forces l'économie de collecte: la formulation borne la quantité de données nécessaire pour vérifier une affirmation.

Décider, sans amender la règle écrite. Le résultat s'énonce dans les termes du protocole: H0 rejetée au seuil de 5% ou H0 conservée.

Restituer les enseignements. Dire ce que le résultat autorise, ce que vaut l'écart mesuré et ce qui reste ouvert.

Que peut-on conclure d'un résultat?

La valeur p, telle que la définit la déclaration de l'American Statistical Association, est la probabilité d'observer des données au moins aussi extrêmes que celles obtenues, en supposant vraies l'hypothèse nulle et le modèle statistique retenu. Elle ne donne donc pas la probabilité que H0 soit vraie, ni celle que les données soient dues au hasard: ces deux lectures inversent le conditionnement et sont les mésinterprétations les plus répandues.

Une hypothèse nulle conservée établit que les données ne la contredisent pas assez fortement au seuil retenu. Un échantillon trop petit produit le même verdict qu'une égalité réelle. C'est pourquoi un test qui conserve H0 s'accompagne toujours de sa puissance ou de l'intervalle de confiance de l'écart, faute de quoi le lecteur entend une preuve d'égalité. Le guide en fait une de ses limites: les résultats sont probabilistes et se transmettent avec leur seuil de signification et leur intervalle.

Significativité statistique et portée pratique

Un écart statistiquement significatif est un écart que le hasard d'échantillonnage explique mal. Sa taille, elle, n'entre pas dans le verdict. La déclaration de l'ASA en fait un principe: la significativité statistique ne mesure ni l'ampleur d'un effet ni son importance. Avec un échantillon assez grand, un écart de CHF 2 par client franchit le seuil aussi sûrement qu'un écart de CHF 200.

La décision métier se prend sur deux lectures superposées: la première dit que l'écart est réel, la seconde compare l'écart et son intervalle au coût de l'action qu'il déclencherait. Un écart significatif dont l'intervalle de confiance recouvre le coût du programme qui le produit ne justifie aucun déploiement, et un écart non significatif sur un pilote de trente personnes ne justifie aucun abandon.

Les pièges

Le seuil déplacé après coup

La forme visible est le seuil relevé de 5% à 10% pour sauver un résultat. La forme discrète est plus fréquente: on teste douze segments, trois canaux et deux périodes, et l'un des dix-sept tests ressort significatif. Au seuil de 5% et pour dix-sept tests indépendants, la probabilité qu'au moins un franchisse le seuil par pur hasard est de 58%. Deux dispositions ferment ce piège: déclarer dans le protocole quels tests seront conduits et corriger le seuil en fonction de leur nombre quand la série est inévitable, ce que fait la correction de Bonferroni.

Un échantillon sans règle de tirage

Le test suppose une règle de tirage connue. Un groupe de volontaires, une base de répondants à un sondage, les clients restants après les départs: ces trois collectes produisent le même résultat statistique qu'un effet réel, sans qu'aucun effet existe. L'écart mesuré porte alors sur la manière dont les gens sont entrés dans l'échantillon. Le protocole nomme la population visée et le mode de tirage; l'écart entre les deux se signale avec le résultat.

L'égalité déduite d'une nulle conservée

« Aucune différence significative » arrive en séance comme « les deux options se valent », et la décision suit. La note de résultat coupe court en donnant l'intervalle: un écart compris entre −CHF 20 et CHF 900 par dossier laisse la question ouverte.

Le test tenu pour la conclusion

Le guide compte parmi ses limites qu'un test établit la solidité statistique d'une affirmation sans tenir lieu d'analyse. S'en remettre à lui seul fait manquer les signaux qu'une exploration des données aurait montrés: une distribution bimodale, une rupture de série datée. Un test conduit sans exploration répond correctement à une question mal choisie.

Un résultat que personne ne sait lire

Le guide relève la difficulté de communiquer le procédé et son résultat aux parties prenantes; il recommande de bâtir leur confiance sur des exemples simples. Un protocole d'une page, un chiffre de référence que le métier reconnaît et une phrase de décision valent mieux qu'une sortie de logiciel. La restitution relève ensuite du data storytelling.

Considérations IA

Le premier emploi porte sur la formulation. Soumettre une affirmation métier vague et demander trois paires H0 et H1 chiffrées, chacune avec sa variable et sa population, force à nommer ce qui restait implicite. Le modèle rend le même service sur le choix de la famille de test: décrire la forme des données et demander quelles conditions le test envisagé suppose donne une liste de vérifications qui restent à conduire.

Le deuxième emploi est l'exécution: produire le code R, Python ou SQL qui calcule la statistique et l'intervalle, à partir d'un protocole déjà écrit. Le troisième est la traduction du résultat pour un comité. Un modèle réécrit une sortie de logiciel en une phrase de décision et propose l'exemple simple qui fait comprendre le procédé.

Le modèle ne connaît pas le mode de constitution de l'échantillon, qui décide de la validité du test, et il tirera sans hésiter une conclusion de données de volontaires. Il ne peut pas fixer α, arbitrage entre deux coûts métier que seule l'organisation chiffre. Surtout, un assistant à qui l'on demande quels écarts franchissent le seuil dans un jeu de données en trouvera toujours: chercher après coup ne coûte plus rien. La seule parade reste le protocole antérieur à la collecte. S'ajoute la sensibilité des données, qui interdit de verser des dossiers de prestations ou des salaires nominatifs dans un service hébergé hors de l'organisation.

Exemples

Une caisse maladie romande teste un programme de coaching de prévention du diabète auprès de 220 membres, avant de décider de l'étendre à tout son portefeuille. Le protocole ci-dessous est daté d'avant l'extraction des données.

Élément du protocoleValeur arrêtée avant la collecte
Variable mesuréeCoût annuel des prestations, en CHF, par membre inscrit
Hypothèse nulle H0Le coût annuel moyen des membres coachés est égal au coût de référence du portefeuille, CHF 4'800
Hypothèse alternative H1Il est inférieur à CHF 4'800
Type de testUnilatéral à gauche, comparaison d'une moyenne à une référence
Seuil de significationα = 5%, valeur critique −1,65 (grand échantillon, approximation normale)
Règle de décisionRejeter H0 si la statistique de test est inférieure à −1,65
Échantillon220 membres inscrits au programme, douze mois de prestations
RésultatValeur
Coût annuel moyen observéCHF 4'350
Écart au coût de référenceCHF 450
Écart-type de l'échantillonCHF 900
Erreur-type de la moyenne900 ÷ √220 = CHF 61
Statistique de test(4'350 − 4'800) ÷ 61 = −7,4
Décision−7,4 est inférieur à −1,65, H0 rejetée au seuil de 5%
Intervalle de confiance à 95% de l'écart, bilatéral par convention450 ± 1,96 × 61 = CHF 330 à CHF 570

Le programme coûte CHF 380 par membre et par an à généraliser. L'économie nette attendue est donc de CHF 70 par membre, dans un intervalle de −CHF 50 à CHF 190: la baisse de coût est établie au seuil retenu, le gain net ne l'est pas. Une note qui s'arrête au verdict statistique envoie le comité déployer le programme sur tout le portefeuille.

Les 220 membres se sont inscrits d'eux-mêmes. Le protocole visait la population assurée et la collecte a fourni des volontaires. Une population qui choisit un programme de prévention se soigne mieux au départ. La conclusion défendable porte sur le coût constaté de ces membres. Attribuer l'écart au coaching demande un tirage au sort des participants, et cet écart entre population visée et échantillon obtenu est signalé au comité en même temps que le chiffre.

Visualisations

Deux objets demandent une forme graphique. La séquence de décision se dessine, parce que sa valeur tient à l'ordre des étapes et à la barrière qui sépare ce qui est fixé avant la collecte de ce qui est calculé après. Le couple significativité statistique et portée pratique se dessine en quadrant, parce que les deux axes sont indépendants et que chacune des quatre cases autorise une action différente.

Le reste s'écrit en tableau: le protocole porte un élément par ligne, la matrice des deux erreurs croise l'état réel et la décision prise. Une note de résultat gagne aussi à montrer l'intervalle de confiance de l'écart sur une échelle en francs, où le coût de l'action se pose comme un repère; cette représentation relève des visualisations métier.

Coût

PhaseNiveauJustification
PréparationMoyenÉcrire le protocole prend une séance avec le métier, où se négocient le chiffre de référence, la direction du test et le seuil.
ExécutionFaibleLe calcul est une fonction de tableur ou une ligne de bibliothèque statistique. Le coût se trouve dans la constitution de l'échantillon, qui appartient à la préparation des données, en amont.
DocumentationFaibleLe protocole et la note de résultat tiennent en une page chacun. Archivés une fois avec la requête qui a produit l'échantillon, ils ne demandent aucune tenue à jour.

Outils

Le protocole se rédige dans un document versionné, et l'outil compte moins que l'horodatage: une page dans l'espace documentaire du projet, validée avant l'extraction, suffit à établir l'antériorité.

Le tableur couvre les cas courants. Excel et LibreOffice Calc offrent les fonctions de test t et de loi normale, plus une extension d'analyse pour les tests z et F et le khi-deux. Ils conviennent à un test unique sur un échantillon déjà extrait et montrent leur limite dès qu'il faut rejouer le calcul à chaque rafraîchissement des données.

Les environnements statistiques sont l'outil de l'équipe de données: R avec ses fonctions natives, Python avec SciPy et statsmodels. Ils donnent la statistique, la valeur p et l'intervalle en une commande, gardent la trace du calcul dans un script lisible et couvrent le dimensionnement de l'échantillon. Des calculateurs de puissance comme G*Power rendent le même service pour qui ne programme pas.

SQL construit l'échantillon et les agrégats qui alimentent le test, rarement le test lui-même. Les plateformes décisionnelles affichent des intervalles de confiance et des bandes d'incertitude autour d'une tendance; elles servent à restituer un résultat obtenu ailleurs, et un intervalle affiché par défaut sur un tableau de bord se lit souvent comme un test qui n'a jamais été formulé.

Sources

Focus Group
Toutes les techniques
Gestion du backlog