Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
- formuler une hypothèse nulle et une hypothèse alternative, expliquer pourquoi elles ne jouent pas le même rôle, et choisir le côté du test avant de regarder les données;
- construire un test complet à partir d'un pivot: statistique de test, région de rejet, seuil, puis conclusion;
- calculer et interpréter une valeur , et énoncer sans hésiter les trois choses qu'elle n'est pas;
- mener les tests usuels — moyenne ( et ), proportion, comparaison de deux moyennes (variance combinée et Welch), échantillons appariés, variance, ajustement et indépendance du khi-deux;
- calculer la puissance d'un test contre un écart donné et la taille d'échantillon nécessaire pour atteindre une puissance de 80 %;
- relier tout test bilatéral à l'intervalle de confiance correspondant, et expliquer pourquoi la publication d'un intervalle vaut mieux que celle d'un verdict de significativité.
La logique d'un test
Une décision sous incertitude
Les chapitres 10 et 11 ont appris à estimer: à produire un nombre, puis un intervalle. Ce chapitre apprend à décider. La différence est réelle. Un contremaître qui lit mm sur 40 pièces n'a pas fini son travail: il doit choisir entre laisser tourner la machine et l'arrêter pour la régler. Un office de la santé qui observe une différence entre deux traitements doit recommander l'un ou l'autre. Une décision ne s'exprime pas en millièmes de millimètre: elle vaut oui ou non.
Or les données ne suffisent jamais à trancher avec certitude. La moyenne d'un échantillon diffère toujours un peu de la valeur nominale, ne serait-ce que par l'aléa d'échantillonnage. La question n'est donc pas «l'écart est-il nul?» — il ne l'est jamais — mais: l'écart observé est-il trop grand pour être attribué au hasard seul? Un test d'hypothèses est une règle de décision qui répond à cette question, et dont on sait calculer les chances de se tromper.
Trois remarques, dès maintenant, sur ce vocabulaire.
Les deux hypothèses ne sont pas symétriques. est privilégiée: on la conserve par défaut. Ce n'est pas une croyance, c'est une convention de prudence, et elle a une raison technique que nous verrons en détail: pour calculer une probabilité, il faut une loi complètement spécifiée, et seule en fournit une. «» détermine entièrement la loi de ; «» ne détermine rien du tout.
Les deux décisions ne sont pas symétriques non plus. On dit «rejeter » ou «ne pas rejeter », jamais «accepter ». Ne pas rejeter, c'est constater que les données ne contredisent pas — ce qui est très différent de la démontrer. Nous y reviendrons trois fois dans ce chapitre, parce que c'est la faute la plus répandue de la statistique appliquée.
est en général l'hypothèse de l'absence d'effet: machine bien réglée, traitement sans influence, dé équilibré, deux variables indépendantes. C'est elle qui décrit le «rien de particulier ne se passe» dont on veut savoir s'il tient.
La présomption d'innocence — et où l'analogie casse
L'analogie classique est celle du procès pénal. est l'innocence de l'accusé: le tribunal la tient pour acquise et ne l'abandonne que devant des preuves suffisantes. est la culpabilité. Un acquittement ne signifie pas que l'innocence est établie, mais que la preuve de la culpabilité n'a pas été apportée. Le doute profite à l'accusé: c'est exactement l'asymétrie que nous venons de décrire, et l'analogie est bonne pour la retenir.
Elle est bonne aussi pour comprendre les deux erreurs possibles: condamner un innocent, et acquitter un coupable. Une justice qui veut ne jamais condamner d'innocent doit relever son exigence de preuve, et acquittera davantage de coupables. Une justice qui veut ne jamais laisser échapper un coupable condamnera des innocents. Aucun système ne supprime les deux erreurs à la fois: il les arbitre. C'est le cœur du chapitre.
Mais l'analogie casse sur trois points, et il faut les connaître.
Premier point: le tribunal ne calcule pas de probabilité. «Au-delà du doute raisonnable» est un standard qualitatif, délibérément non chiffré. Le test, lui, fixe un nombre — , — et ce nombre ne mesure pas la force de la preuve dans une affaire donnée: il mesure la fréquence à long terme des condamnations d'innocents sur l'ensemble des affaires jugées par cette règle. C'est une garantie de procédure, pas une garantie de cas.
Deuxième point: l'accusé est coupable ou innocent, mais l'hypothèse nulle est presque toujours fausse. Aucune machine n'est réglée à exactement 20,000000 mm, aucun traitement n'a exactement zéro effet. Si l'on prélève assez de pièces, on finira toujours par rejeter , parce que le vrai diffère de 20,00 d'une quantité minuscule mais non nulle. Un rejet n'est donc pas la découverte d'une vérité: c'est le constat que l'échantillon est assez grand pour voir l'écart. Nous en tirerons les conséquences dans la dernière section.
Troisième point: la justice ne choisit pas qui elle poursuit au vu du verdict espéré. Le statisticien, lui, peut regarder ses données, choisir ensuite l'hypothèse qui l'arrange, et refaire l'analyse jusqu'à obtenir ce qu'il souhaite. Cette liberté n'a pas d'équivalent judiciaire, et c'est elle qui rend la discipline vulnérable — c'est le p-hacking de la dernière section.
Un test ne rejette pas . Quelle conclusion est correcte?
Les deux risques
Quatre cases, deux erreurs
Confrontons la décision à la réalité. Il y a quatre situations possibles, dont deux sont des erreurs.
| est vraie | est fausse | |
|---|---|---|
| On rejette | erreur de 1re espèce, probabilité | décision correcte, probabilité (puissance) |
Observez soigneusement la différence de nature entre (12.1) et (12.2). Le risque est un nombre, parce que spécifie une seule loi. Le risque est une fonction: il dépend de la valeur vraie du paramètre, et il n'a aucun sens de parler de «» sans dire contre quel écart. Contre un écart énorme, est minuscule; contre un écart infinitésimal, vaut presque : un écart assez petit est indétectable, et il le reste quel que soit le talent du statisticien.
C'est pourquoi les deux risques ne se traitent pas de la même façon. On fixe à l'avance — c'est le seuil du test, le prix que l'on accepte de payer en fausses alarmes. On calcule ensuite, contre les écarts qui comptent pour le métier.
L'arbitrage, à fixé
Pourquoi ne pas simplement prendre très petit? Parce qu'à taille d'échantillon fixée, les deux risques varient en sens contraire. Diminuer recule les frontières de la région de rejet, donc il devient plus difficile de rejeter — y compris lorsque est fausse. Mécaniquement, augmente.
Le chiffrage sur le cas de l'atelier est éloquent. Avec mm supposé connu, pièces et un vrai décalage de mm, la puissance vaut
| Seuil | 0,01 | 0,05 | 0,10 |
|---|---|---|---|
| Puissance | 0,391 | 0,633 | 0,744 |
Passer de à divise presque par deux les fausses alarmes et fait perdre un quart de la puissance. Il n'y a pas de réglage universellement bon: le réglage dépend du coût des deux erreurs. Arrêter une machine qui tournait bien coûte une demi-journée de production; livrer des milliers d'axes hors cote coûte un client. C'est cette comparaison — et non une convention — qui devrait fixer .
Le seul moyen d'améliorer les deux risques à la fois est d'augmenter . C'est exactement ce que nous avions constaté pour les intervalles de confiance au chapitre 11: fiabilité et précision se paient l'une l'autre, et seul l'échantillon les achète toutes les deux.
La figure 12.1 est à regarder longtemps. Trois choses y sont visibles et aucune n'est évidente sur une formule.
D'abord, les deux aires ne sont pas sous la même courbe: se lit sous la loi de , sous la loi de . Additionner et n'a donc aucun sens, et lire «» quelque part doit déclencher une alarme.
Ensuite, les deux aires sont séparées par la même frontière: la valeur critique. Déplacer cette frontière vers la droite diminue l'aire en aplat et augmente l'aire hachurée, et inversement. L'arbitrage est là, géométriquement.
Enfin, les deux courbes se chevauchent, et c'est tout le problème. Si les deux lois étaient disjointes, on lirait la vérité sans erreur. Le chevauchement est gouverné par l'écart réduit : augmenter resserre les deux courbes et les sépare, sans rien changer à l'écart réel.
Pour le test bilatéral de l'atelier ( mm connu, , ), quelle est la puissance si la machine est en réalité décalée à mm?
Statistique de test, région de rejet, seuil
Les trois objets
Tout test se construit dans cet ordre, et l'ordre est essentiel: on choisit , puis , puis — et seulement ensuite on regarde les données. Inverser les deux dernières étapes, c'est-à-dire fixer la région de rejet après avoir vu où tombe , détruit la garantie (12.1) et transforme le test en illusion.
Construction complète, à partir du pivot du chapitre 11
Faisons-le une fois, lentement, sur le cas de la moyenne à écart type inconnu. Le chapitre 11 a établi que, pour un échantillon i.i.d. de loi ,
et que cette loi ne dépend ni de ni de : c'est un pivot. Le test s'en déduit en cinq étapes.
Étape 1 — poser les hypothèses. On veut savoir si la machine est centrée sur la valeur nominale mm. Un déréglage dans un sens comme dans l'autre est également gênant, donc
Étape 2 — fabriquer la statistique de test. Le pivot (12.3) contient l'inconnue , donc il n'est pas calculable. Mais sous , vaut , qui est un nombre. On remplace, et l'on obtient une quantité calculable dont on connaît la loi sous :
C'est la manœuvre à retenir: une statistique de test est un pivot dans lequel on a substitué la valeur imposée par . Tous les tests de ce chapitre s'obtiennent ainsi, à partir des pivots du chapitre 11.
Étape 3 — choisir le seuil. Prenons : nous acceptons d'arrêter à tort une machine bien réglée cinq fois sur cent.
Étape 4 — délimiter la région de rejet. est bilatérale, donc une valeur très négative comme une valeur très positive de témoigne contre : la région de rejet est symétrique, . La constante est déterminée par la contrainte de seuil:
Pour et , la bissection sur la fonction de répartition de Student donne .
Étape 5 — décider. On calcule sur les données et l'on rejette si .
Démonstration. Sous , , donc la statistique (12.4) est exactement le pivot (12.3), dont la loi est . Par définition du quantile et par symétrie de la loi de Student,
Le mot exactement est à prendre au sérieux: il tient tant que les sont normales et indépendantes. Si la loi n'est pas normale, le théorème central limite (chapitre 8) rend le niveau approché pour grand — bon en pratique dès pour une loi peu dissymétrique, franchement mauvais pour une loi très asymétrique ou à valeurs extrêmes. Le niveau annoncé n'est jamais meilleur que les hypothèses qui le portent.
Remettez dans l'ordre les étapes de la construction d'un test.
Glissez les éléments pour les mettre dans le bon ordre
- Choisir une statistique de test dont la loi est connue sous
- Fixer le seuil que l'on accepte en fausses alarmes
- Écrire et , en fixant le côté de l'alternative
- Délimiter la région de rejet en résolvant la contrainte de seuil
- Calculer la statistique sur les données observées et conclure
La valeur p
Un verdict gradué plutôt qu'un verdict binaire
La règle (12.6) répond par oui ou par non. Elle jette pourtant de l'information: et conduisent au même rejet, alors que le second est infiniment plus net. La valeur conserve cette gradation.
La valeur se calcule donc dans la loi de sous — une loi tabulée, ici la loi de Student. Et elle rend le seuil transparent:
Démonstration de (12.8), cas bilatéral. Notons la fonction de répartition de . On a , fonction strictement décroissante de . Donc équivaut à , c'est-à-dire à , c'est-à-dire à : c'est exactement (12.6).
Autrement dit, la valeur est le plus petit seuil auquel les données conduiraient au rejet. C'est sa définition opérationnelle, et la plus utile: publier , c'est dire «ces données rejettent à , à , mais pas à ni à », ce qu'un simple «significatif à » ne dit pas.
La figure 12.2 met les deux règles côte à côte. Le panneau du haut décrit la procédure, fixée avant l'expérience; le panneau du bas décrit ce que cet échantillon-ci a produit. L'équivalence (12.8) se lit géométriquement: la valeur observée tombe dans la région de rejet si et seulement si l'aire bleue est contenue dans cette région, c'est-à-dire si et seulement si .
La mise en garde que tout le cours préparait
L'analogie du dépistage mérite d'être poussée jusqu'au bout, parce qu'elle chiffre le piège. Imaginons mille hypothèses testées dans un domaine de recherche, dont sont réellement vraies au sens de — c'est le rôle de la prévalence. Avec et une puissance de (données fictives, mais l'ordre de grandeur de la puissance est réaliste dans beaucoup de disciplines):
| vraie (100) | vraie (900) | total | |
|---|---|---|---|
| Rejet («significatif») | 80 | 45 | 125 |
| Non-rejet | 20 | 855 | 875 |
Sur les 125 résultats déclarés significatifs, 45 sont faux, soit . La «valeur prédictive positive» d'un résultat significatif vaut donc — et non . Si la puissance tombe à , ce qui est fréquent sur de petits échantillons, elle descend à : la majorité des résultats significatifs sont alors faux. C'est, trait pour trait, l'argument du dépistage d'une maladie rare du chapitre 2. Le seuil contrôle une probabilité conditionnelle; il ne contrôle pas celle qui intéresse le lecteur.
Un test donne une valeur de . Quelle affirmation est correcte?
Unilatéral ou bilatéral
Le côté se choisit avec la question, pas avec les données
L'alternative peut prendre trois formes:
La région de rejet suit: dans le premier cas, dans le deuxième, dans le troisième. Notez le passage de à : le test unilatéral place tout son risque du même côté, donc sa valeur critique est plus basse et il est — dans la direction prévue seulement.
Le choix se fait sur la question posée, jamais sur les données.
- «La machine est-elle déréglée?» — un déréglage des deux côtés est gênant: bilatéral.
- «Le taux de pièces hors tolérance dépasse-t-il les promis par le fournisseur?» — un taux plus bas ne pose aucun problème et ne déclenchera aucune action: unilatéral à droite.
- «Le nouveau réglage a-t-il réduit la dispersion?» — on ne l'installera que s'il fait mieux: unilatéral à gauche sur la variance.
Enfin, la relation entre les deux valeurs est élémentaire et utile pour relire un article: lorsque l'écart observé va dans le sens de l'alternative unilatérale, . Un article qui annonce sans préciser le côté a peut-être publié la moitié d'un .
Test sur une moyenne
Écart type connu: le test
Si est connu — cas rare, mais instructif et parfois réaliste quand un appareil de mesure a un écart type documenté —, le pivot est et la statistique de test est
avec les valeurs critiques (bilatéral) ou (unilatéral). Les trois quantiles à connaître, calculés par bissection sur : , et .
Écart type inconnu: le test
C'est le cas ordinaire, et c'est le théorème 12.1: on remplace par et la loi normale par la loi de Student à degrés de liberté. Rien d'autre ne change.
Ce qu'un non-rejet autorise à dire — et ce qu'il n'autorise pas
Ce résultat est le plus important du chapitre, précisément parce qu'il n'est pas un rejet. Détaillons ce qu'on peut en faire.
Ce que l'on peut dire. Les données ne mettent pas en évidence de déréglage. Le contremaître n'a pas de raison, sur cette base, d'arrêter la machine. Mieux: l'intervalle de confiance du chapitre 11, , ajoute une information que le test ne donne pas — aucun déréglage supérieur à mm n'est compatible avec ces 40 mesures. C'est une conclusion positive, et elle est utile.
Ce que l'on ne peut pas dire. Que la machine est centrée sur 20,00 mm. Que . Que l'écart observé est «dû au hasard» — nous n'en savons rien; il est compatible avec le hasard. Encore moins qu'il y a de chances que soit vraie: la valeur n'est pas cette probabilité-là.
Ce qu'il faut ajouter pour que le non-rejet ait du poids. La puissance. Nous calculerons plus loin que ce test, contre un décalage réel de mm, a une puissance de : il en manquerait un sur trois. Un non-rejet issu d'un test qui se trompe une fois sur trois est une information faible; c'est pourquoi un rapport sérieux écrit «non rejeté (), avec une puissance de contre un décalage de deux centièmes» et non «la machine est conforme».
Un laboratoire mesure 16 fois une pièce étalon et obtient mm et mm. On teste contre . Quelle est la valeur absolue de la statistique de test?
Test sur une proportion
Le test approché
Pour une proportion, le chapitre 11 a donné le pivot approché issu du théorème central limite. Sous , la proportion empirique vérifie
Un détail mérite attention: au dénominateur figure et non . C'est la différence avec l'intervalle de Wald du chapitre 11, et elle est logique: sous la variance est connue, puisque fixe . Le test est d'ailleurs un peu meilleur pour cela.
Conditions d'emploi: l'approximation normale exige et . Hors de ces conditions, il faut passer au test exact fondé sur la loi binomiale.
Sur pièces, on observe de rebuts et l'on teste contre . Quelle est la statistique de test?
Comparaison de deux moyennes
Le test à variance commune
C'est la question la plus fréquente de la statistique appliquée: deux machines, deux traitements, deux fournisseurs. Soient deux échantillons indépendants, de loi et de loi , de . Le chapitre 11 a construit le pivot; sous il devient la statistique de test
La variance combinée est la moyenne des deux variances empiriques pondérée par les degrés de liberté: l'échantillon le plus gros pèse le plus, ce qui est juste.
L'hypothèse d'égalité des variances se vérifie, elle ne se suppose pas
(12.12) repose sur . Cette hypothèse n'est pas décorative: si les variances diffèrent beaucoup et que les tailles d'échantillon diffèrent aussi, le niveau réel du test s'écarte franchement du niveau annoncé. Il faut donc la regarder.
Le contrôle élémentaire est le rapport des variances empiriques, dont la loi sous est une loi de Fisher . Sur nos deux machines,
soit un écart de moins de : rien ne s'oppose à l'hypothèse de variance commune. Notez toutefois que le test de Fisher est lui-même très sensible à la non-normalité — plus sensible que le test qu'il est censé valider. C'est pourquoi beaucoup de praticiens ne le font pas et utilisent d'emblée le test de Welch, qui ne suppose rien.
Le test de Welch
Lorsque l'égalité des variances n'est pas acquise, on remplace l'erreur type combinée par la somme des deux erreurs types, et le nombre de degrés de liberté par l'approximation de Welch–Satterthwaite:
Le nombre n'est pas entier, et il est compris entre et . La loi de n'est qu'approximativement une loi de Student: Welch est un test , mais son approximation est excellente, y compris lorsque les variances sont égales. C'est la raison pour laquelle il est le choix par défaut de la plupart des logiciels.
Le test de Welch se distingue du test à variance combinée parce que:
Échantillons appariés
Pourquoi l'appariement change tout
Si les deux séries portent sur les mêmes individus — deux appareils de mesure appliqués aux mêmes pièces, une grandeur mesurée avant et après un réglage —, les deux échantillons ne sont pas indépendants et (12.12) ne s'applique pas. Le bon modèle travaille sur les différences individuelles
qui forment un seul échantillon. On teste alors par le test de Student à un échantillon du théorème 12.1, avec degrés de liberté.
L'intérêt n'est pas théorique, il est quantitatif: la variabilité entre individus — ici, le fait que les dix pièces mesurées n'ont pas le même diamètre — disparaît de la différence. Ce qui reste est la seule variabilité qui intéresse.
Test sur une variance
Certaines questions portent sur la dispersion elle-même: un cahier des charges impose souvent un écart type maximal, parce que c'est lui qui gouverne la proportion de pièces hors tolérance. Le pivot est celui du chapitre 11:
Sous , la statistique de test est donc , et l'on rejette pour les grandes valeurs si , pour les petites si , et des deux côtés (avec dans chaque queue) si . Attention: la loi du khi-deux n'est , donc les deux valeurs critiques bilatérales ne sont pas opposées l'une de l'autre.
Les tests du khi-deux
Les tests précédents portaient sur un paramètre. Les tests du khi-deux portent sur la forme d'une distribution ou sur la structure d'un tableau, en comparant des effectifs observés à des effectifs attendus.
Test d'ajustement
Pourquoi cette forme, et pourquoi degrés de liberté. Chaque est de loi binomiale , d'espérance et de variance . Le terme est donc, à peu près, le carré d'un écart réduit: c'est la version discrète du carré d'une variable centrée réduite, et une somme de tels carrés est un khi-deux (chapitre 9). Le nombre de degrés de liberté n'est que et non parce que les écarts sont liés par : la dernière classe est déterminée par les autres. Chaque paramètre estimé sur les données consomme un degré supplémentaire, d'où le . La démonstration complète (loi multinomiale et son approximation gaussienne) dépasse le cadre de ce cours et est .
Test d'indépendance sur un tableau de contingence
Le même mécanisme teste l'indépendance de deux variables qualitatives croisées dans un tableau à lignes et colonnes. L'hypothèse nulle est : «les deux variables sont indépendantes», ce qui, par la définition du chapitre 7, signifie que chaque probabilité conjointe est le produit des deux probabilités marginales. En remplaçant les probabilités marginales par leurs estimations et , on obtient l'effectif attendu de la case :
— «total de la ligne fois total de la colonne, divisé par le total général». La statistique est encore (12.15), sommée sur les cases, et le nombre de degrés de liberté vaut
D'où vient (12.17). Il y a cases, donc degrés de liberté avant estimation. On a estimé probabilités de ligne et probabilités de colonne (la dernière de chaque groupe se déduit, les probabilités sommant à 1), soit paramètres. Il reste .
Dans le tableau de l'exemple, quel est l'effectif attendu de la case «équipe de nuit, rebut» sous l'hypothèse d'indépendance?
Puissance et taille d'échantillon
Calculer une puissance
Reprenons le test bilatéral sur une moyenne, avec connu pour que le calcul soit exact. La région de rejet est . Si la vraie moyenne vaut , alors et
Le second terme est négligeable dès que est appréciable, et la formule se lit alors d'un coup d'œil: tout dépend de l'écart réduit . Doubler ou quadrupler ont exactement le même effet sur la puissance.
Sur le test de l'atelier ( mm, bilatéral), la puissance vaut:
| Écart réel (mm) | ||||
|---|---|---|---|---|
| 0,005 | 0,060 | 0,089 | 0,149 | 0,251 |
| 0,010 | 0,089 | 0,210 | 0,444 | 0,730 |
| 0,020 | 0,210 | 0,633 | 0,953 | 0,999 |
| 0,030 | 0,407 | 0,932 | 1,000 | 1,000 |
| 0,050 | 0,820 | 1,000 | 1,000 | 1,000 |
(Les «1,000» sont des arrondis: la puissance n'atteint jamais 1 exactement.)
Trois lectures. Première colonne: avec dix pièces, on ne détecte rien en dessous de trois centièmes — un contrôle de dix pièces est un rituel, pas une mesure. Ligne : c'est le cas de l'exemple 12.1, et la puissance à vaut . Notre non-rejet est donc à lire avec cette réserve: si la machine avait été décalée de deux centièmes, ce test l'aurait manquée une fois sur trois. Coin supérieur gauche: pour et , la puissance vaut , à peine plus que . Un test sans puissance rejette presque exactement aussi souvent que si était vraie: il ne mesure rien.
Dimensionner l'échantillon
On retourne (12.18). En négligeant le terme négligeable, la puissance atteint dès que
Avec la convention la plus répandue, et une puissance de , les deux quantiles valent et , de somme . Pour l'atelier ( mm):
| Écart à détecter (mm) | 0,005 | 0,010 | 0,020 | 0,030 | 0,050 |
|---|---|---|---|---|---|
| nécessaire (puissance 80 %) | 950 | 238 | 60 | 27 | 10 |
La dépendance en est brutale: détecter un écart deux fois plus petit coûte quatre fois plus de pièces. C'est la même loi en racine de que pour la demi-largeur d'un intervalle de confiance (chapitre 11), et c'est la raison économique pour laquelle on ne cherche pas à détecter n'importe quoi: on fixe d'abord l'écart qui compte pour le métier — ici, un décalage qui ferait sortir des pièces de la tolérance — et on dimensionne pour celui-là.
Test bilatéral de H₀: μ = 20,000 mm contre H₁: μ ≠ 20,000, avec σ = 0,055 mm connu. Déplacez l'écart réel, la taille de l'échantillon et le seuil: la puissance monte avec n et avec l'écart, et descend quand on exige un seuil plus sévère. Les valeurs critiques, elles, ne bougent pas quand on change l'écart réel.
Déplacez les trois curseurs de l'explorateur et vérifiez les trois faits de la section: la puissance monte avec et avec l'écart réel, elle descend quand diminue — et les valeurs critiques , affichées en readout, ne bougent pas quand on change l'écart réel. Ce dernier point est la traduction visuelle d'une exigence du protocole: la région de rejet est fixée avant de savoir quel écart on cherchera à détecter.
Combien de pièces faut-il prélever pour détecter un décalage de mm avec une puissance de , au seuil bilatéral de , si mm?
Dualité entre tests et intervalles de confiance
L'énoncé
Démonstration, sur le cas de la moyenne à écart type inconnu. Posons . Par le théorème 12.1, le test ne rejette pas si et seulement si
et le dernier encadrement dit exactement que appartient à l'intervalle (11.11) du chapitre 11. Les trois équivalences sont des manipulations d'inégalités sur des nombres, valables pour chaque échantillon observé.
Vérifions-le sur nos données. L'intervalle de l'atelier est et il contient : le test de l'exemple 12.1 ne rejette pas, et c'est bien ce que nous avons trouvé (). Il contient aussi et : un test de ne rejetterait pas non plus. En revanche est hors de l'intervalle, et le test correspondant rejetterait. , alors qu'un test n'en traite qu'une.
De même, l'intervalle pour , , ne contient pas 0: le test de l'exemple 12.4 rejette, et il le fait avec . Et l'intervalle du sondage, , : le test de l'exemple 12.2 ne rejette pas. Les trois cas concordent, et ils ne pouvaient pas faire autrement.
Lequel des deux publier
Une réserve pour être complet: la dualité (12.20) vaut entre un test bilatéral et un intervalle bilatéral, et entre un test unilatéral et un intervalle unilatéral (chapitre 11). Un test unilatéral confronté à un intervalle bilatéral ne coïncide pas — c'est une source classique de confusion dans les rapports.
Ce que la mesure ne dit pas
Ce cours enseigne à mesurer. Il doit donc enseigner aussi ce que la mesure ne dit pas, parce que la moitié des mauvaises utilisations de la statistique consiste à faire dire à un test quelque chose qu'il ne dit pas.
Tests multiples: les ne sont pas ceux que l'on croit
Le seuil garantit une probabilité de fausse alarme de pour un test. Si l'on en fait vingt, indépendants, sur des hypothèses toutes vraies, la probabilité d'obtenir au moins un rejet vaut
Près de deux chances sur trois d'obtenir au moins un résultat «significatif» alors que rien n'est vrai. Avec cinq tests, la probabilité est déjà de ; avec cent tests, de . Un chercheur qui explore vingt variables et publie celle qui «sort» ne publie pas une découverte: il publie le maximum de vingt tirages.
Le correctif le plus simple est celui de Bonferroni: pour garantir un risque global sur tests, on teste chacun au seuil . Pour et , cela donne par test, soit une valeur critique de au lieu de — et le risque global obtenu vaut , comme voulu. Bonferroni est conservateur (il perd de la puissance, d'autant plus que est grand et que les tests sont corrélés), et des procédures plus fines existent — contrôle du taux de fausses découvertes de Benjamini–Hochberg, notamment —, mais l'essentiel est ailleurs: . Un seuil ne veut rien dire sans le dénombrement des tentatives.
P-hacking: le nombre de tests est rarement connu
Le problème des tests multiples serait gérable s'il était visible. Il l'est rarement, parce que les tentatives sont souvent implicites:
- essayer plusieurs variables de résultat et garder celle qui fonctionne;
- essayer plusieurs sous-groupes (les hommes, les femmes, les moins de 30 ans);
- décider d'arrêter la collecte quand passe sous (la probabilité de traverser le seuil finit par valoir 1 si l'on peut collecter indéfiniment);
- retirer des valeurs jugées aberrantes après avoir vu leur effet sur le résultat;
- choisir le côté du test après coup, comme nous l'avons chiffré plus haut (un risque réel de pour un seuil annoncé de ).
Aucune de ces manœuvres n'est nécessairement malhonnête: chacune peut se présenter comme une décision d'analyse raisonnable. Leur effet cumulé, lui, est parfaitement quantifiable et considérable. Le remède est procédural: pré-enregistrer le protocole — hypothèses, côté, seuil, taille d'échantillon, règle d'arrêt, traitement des valeurs extrêmes — avant de collecter, et rapporter séparément ce qui a été prévu et ce qui a été exploré. Une analyse exploratoire est utile et légitime; elle n'a simplement pas le même statut de preuve, et elle appelle une vérification sur de nouvelles données.
Significativité statistique et importance pratique
Nous l'avons vu trois fois, chiffrons-le une dernière. Avec mm, un décalage réel de mm — le vingtième d'un centième, sans aucune conséquence sur une tolérance de mm — donne un écart réduit égal à pour pièces: le test rejette, avec une valeur de l'ordre de . Le rejet est correct, la conclusion «la machine est déréglée» est techniquement vraie, et elle est .
Symétriquement, le de Cramér de de l'exemple 12.8 dit que le lien entre équipe et qualité, bien que détecté, est faible. Un test répond à «peut-on exclure le hasard?»; il ne répond jamais à «est-ce que cela compte?». La seconde question demande une taille d'effet, une unité, et un jugement de métier.
Le problème de la reproductibilité
Depuis les années 2010, plusieurs disciplines ont entrepris de reproduire systématiquement leurs propres résultats publiés. La plus connue de ces entreprises, la réplication de cent études de psychologie publiée en 2015 par l'Open Science Collaboration, a retrouvé un résultat statistiquement significatif dans environ des cas, avec des tailles d'effet en moyenne deux fois plus petites que celles publiées à l'origine. Des taux comparables ont été rapportés en biologie du cancer et en économie expérimentale; l'ampleur exacte du phénomène est discutée, sa réalité ne l'est plus.
Les causes ne sont pas mystérieuses, et ce chapitre les a toutes nommées: une puissance insuffisante (qui fait que les résultats significatifs sont dominés par les faux positifs, comme le montre le tableau de la valeur prédictive positive), des tests multiples non déclarés, le p-hacking, et un biais de publication qui ne retient que les résultats significatifs — de sorte que les de fausses alarmes de chaque étude se concentrent dans la littérature publiée. Rien de tout cela n'est une faiblesse des mathématiques exposées ici: (12.1) reste exacte. C'est la procédure autour du calcul qui décide de ce que le calcul vaut.
Ce qui vient après
Ce chapitre clôt le cours, mais il ouvre trois portes, et il vaut la peine de dire où elles mènent.
La régression. Toutes les comparaisons de ce chapitre confrontent des groupes. La question naturelle suivante est celle d'une relation continue: comment la résistance d'un béton dépend-elle du rapport eau/ciment, la consommation d'un ménage de son revenu, le temps d'usinage de la vitesse de coupe? Le modèle de régression linéaire répond, et il réutilise mot pour mot ce que vous savez: la méthode des moindres carrés est un cas d'estimation (chapitre 10), les coefficients estimés ont des lois de Student, on leur attache des intervalles de confiance (chapitre 11), et « est-il nul?» est un test de Student exactement du type du théorème 12.1. L'analyse de la variance (ANOVA), qui compare plus de deux moyennes à la fois, est la généralisation du test de la section «comparaison de deux moyennes», et sa statistique suit une loi de Fisher.
L'économétrie poursuit dans cette direction avec la difficulté propre aux données non expérimentales: quand on ne peut pas répartir au hasard, une corrélation ne devient pas une causalité parce qu'elle est significative. Variables instrumentales, doubles différences, discontinuité de régression sont des réponses à cette difficulté, et elles supposent acquis tout ce chapitre.
La statistique pour les sciences sociales ajoute les tests non paramétriques (lorsque la normalité n'est pas défendable), les modèles pour variables qualitatives (régression logistique), et une réflexion sur les plans d'expérience et d'enquête — échantillonnage stratifié, non-réponse, pondération — qui décide de la validité d'une conclusion bien avant que le premier test ne soit calculé.
Ces trois cours prolongent le vôtre. Aucun ne le remplace: ils supposent tous que vous savez ce qu'est une loi, un estimateur, un intervalle et un risque de première espèce.
Synthèse
- Un test oppose une hypothèse nulle , tenue pour acquise et seule à fournir une loi calculable, à une alternative . On rejette ou l'on ne rejette pas ; on ne l'accepte jamais. L'analogie de la présomption d'innocence porte l'asymétrie, mais pas le fait que est presque toujours fausse à la dernière décimale.
Un ingénieur veut savoir si un nouveau réglage a augmenté le diamètre moyen. Quelle alternative doit-il retenir?
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Un fournisseur garantit une résistance moyenne de 50 MPa pour un lot de béton, avec un écart type connu MPa. Un laboratoire teste éprouvettes et obtient MPa (données fictives).
- Le client craint une résistance insuffisante. Formulez et , puis menez le test au seuil de .
Sur pièces prélevées dans une production, 18 sont rebutées (données fictives). Le service qualité affirme que le taux de rebut ne dépasse pas .
- Vérifiez les conditions d'emploi du test approché, puis menez le test unilatéral au seuil de .
- Donnez la valeur et concluez.
- Le même taux observé sur pièces (soit 4,5 rebuts, arrondissons à 5 sur 100, donc ) conduirait-il à la même conclusion? Que montre la comparaison?
Deux fournisseurs de résistances sont comparés (données fictives). Fournisseur 1: , , . Fournisseur 2: , , . On donne .
Deux ateliers sont comparés sur la qualité de 280 pièces réparties en trois classes (données fictives):
| Atelier | Classe A | Classe B | Classe C | total |
|---|---|---|---|---|
| Atelier 1 | 30 | 50 | 40 | 120 |
| Atelier 2 | 70 | 60 | 30 | 160 |
| total | 100 | 110 | 70 | 280 |
- Calculez les six effectifs attendus sous l'hypothèse d'indépendance et vérifiez leurs marges.
- Calculez la statistique du khi-deux et son nombre de degrés de liberté, puis concluez au seuil de (on donne et ).
- Un laboratoire teste au seuil de l'effet de 20 additifs sur la résistance d'un béton, tous parfaitement inefficaces. Quelle est la probabilité qu'au moins un additif apparaisse «significatif»? Quel seuil individuel Bonferroni impose-t-il pour ramener le risque global à , et quelle est alors la valeur critique bilatérale du test ?
- Le laboratoire publie l'additif le plus prometteur avec . Que vaut cette valeur ?
- Démontrez la dualité (12.20) pour le test sur une moyenne, à écart type connu.
Références
- Ross, S. M., Initiation aux probabilités, Presses polytechniques et universitaires romandes, Lausanne — chapitres sur l'inférence statistique: tests sur une moyenne, sur une proportion et tests du khi-deux.
- Morgenthaler, S., Introduction à la statistique, Presses polytechniques et universitaires romandes, Lausanne — présentation des tests dans l'esprit d'un cours d'ingénieur de l'EPFL, avec les conditions d'emploi discutées.
- Wackerly, D., Mendenhall, W. & Scheaffer, R., Mathematical Statistics with Applications, Cengage — chapitre sur les tests d'hypothèses, avec les calculs de puissance et le lemme de Neyman–Pearson pour aller plus loin.
- Rice, J. A., Mathematical Statistics and Data Analysis, Duxbury — tests du khi-deux, tableaux de contingence et discussion des effectifs attendus faibles.
- Saporta, G., Probabilités, analyse des données et statistique, Technip — vue d'ensemble des tests paramétriques et non paramétriques, et transition vers la régression.
- Wasserstein, R. L. & Lazar, N. A., «The ASA Statement on p-Values: Context, Process, and Purpose», The American Statistician, vol. 70, 2016 — la mise au point officielle de l'American Statistical Association sur ce que la valeur dit et ne dit pas.