Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
- expliquer pourquoi une estimation ponctuelle seule est une information incomplète et ce qu'apporte un intervalle aléatoire;
- construire un intervalle de confiance par la méthode du pivot, en inversant pas à pas une inégalité, et appliquer cette méthode à un paramètre que vous n'avez jamais rencontré;
- calculer un intervalle de confiance pour une moyenne (écart-type connu, puis inconnu avec la loi de Student), pour une variance et un écart-type (pivot du khi-deux), et pour une proportion (intervalle de Wald, avec ses conditions et ses défauts);
- énoncer correctement ce que signifie «à 95 %» — et pourquoi la phrase « est dans cet intervalle avec probabilité 0,95» est fausse une fois l'intervalle calculé;
- choisir entre un intervalle bilatéral et un intervalle unilatéral, et déterminer la taille d'échantillon nécessaire pour atteindre une précision fixée;
- construire un intervalle pour la différence de deux moyennes et pressentir la dualité entre intervalles de confiance et tests d'hypothèses.
D'une estimation ponctuelle à un intervalle
Pourquoi un nombre ne suffit pas
Le chapitre 10 a construit des estimateurs: la moyenne empirique pour , la variance empirique pour , la fréquence pour une proportion. Tous sont sans biais et convergents. Mais un estimateur convergent produit, sur un échantillon donné, , et ce nombre est presque sûrement faux: la probabilité que soit exactement égal à est nulle dès que la loi est continue.
Reprenons l'atelier d'usinage «Jura Précision», qui tourne des axes de diamètre nominal mm. Un contrôle de pièces donne
Le contremaître apprend donc que la machine produit «en moyenne 20,003 mm». Mais que faire de ce nombre? Si l'on refaisait le contrôle demain sur 40 autres pièces, on trouverait 19,997, ou 20,008, ou 20,001. L'estimation ponctuelle ne dit rien de cette dispersion, donc rien de ce qu'on a le droit d'en conclure. En particulier, elle ne permet pas de répondre à la seule question qui intéresse l'atelier: la machine est-elle réglée sur 20,00, ou a-t-elle dérivé?
Il manque une échelle d'incertitude. On la connaît pourtant: le chapitre 9 a établi que l'écart-type de vaut , l'erreur type (en anglais standard error). Ici, en remplaçant par son estimation ,
L'idée de l'intervalle de confiance est de transformer cette erreur type en une fourchette assortie d'une garantie probabiliste explicite.
Un intervalle dont les bornes sont aléatoires
Il faut prendre au sérieux le fait que les bornes de la fourchette sont calculées à partir de l'échantillon: elles sont donc aléatoires, exactement comme . C'est là toute la subtilité du chapitre, et la source de son unique grand contresens.
Deux remarques sur cette définition, qui vont piloter tout le chapitre.
Premièrement, la condition «pour toute valeur de » est essentielle. Il serait facile de fabriquer un intervalle qui contient avec probabilité 0,95 si vaut 20: il suffirait de prendre quel que soit l'échantillon. Un tel intervalle n'est évidemment d'aucune utilité, car sa garantie s'effondre pour les autres valeurs de . La définition exige que la garantie tienne uniformément.
Deuxièmement, et ne doivent pas dépendre de : sinon on ne saurait pas les calculer. Ce sont des statistiques, c'est-à-dire des fonctions des seules observations. Toute la difficulté technique consiste à obtenir une probabilité qui, elle, ne dépend pas de , alors que la loi des en dépend. C'est exactement ce que résout la méthode du pivot.
Enfin, on souhaite naturellement que l'intervalle soit court: est un intervalle de confiance de niveau 1 pour n'importe quel paramètre, et il est parfaitement inutile. La longueur de l'intervalle mesure la précision de l'étude; le niveau mesure la fiabilité de la procédure. Les deux se paient l'un l'autre: à échantillon fixé, exiger plus de fiabilité allonge l'intervalle. Le seul moyen d'améliorer les deux à la fois est d'augmenter .
La méthode du pivot
La fonction pivotale
Voici la seule technique de construction qu'il faut vraiment retenir; les quatre intervalles du chapitre en sortent tous.
Un pivot n'est pas une statistique: il contient , donc on ne peut pas le calculer à partir des seules données. C'est précisément ce mélange qui le rend utile: sa loi étant connue et fixe, on peut écrire une inégalité de probabilité sur , puis la résoudre en .
Le premier exemple est celui du chapitre 9. Si sont i.i.d. de loi avec connu, alors et, en standardisant,
La loi de est quelle que soit la valeur de : est un pivot pour . C'est l'ingrédient unique de la construction qui suit.
L'inversion, pas à pas
Faisons ce calcul une fois, lentement. Toutes les constructions du chapitre le répètent, à la loi près.
Étape 1 — encadrer le pivot. On choisit le niveau , par exemple , donc . On cherche deux nombres et , lus dans la table de la loi du pivot, tels que . La loi étant symétrique, le choix le plus économique — celui qui donne l'intervalle le plus court — consiste à couper en deux moitiés égales et à prendre , , où est le quantile d'ordre de la loi normale centrée réduite, c'est-à-dire la solution de . Pour : donne , soit . On écrit donc
Étape 2 — isoler au centre. L'événement entre parenthèses est une double inégalité; transformons-la par des opérations qui la laissent équivalente, donc qui ne changent pas sa probabilité. Multiplions les trois membres par , qui est strictement positif, donc le sens des inégalités est conservé:
Retranchons partout:
Multiplions par : les inégalités changent de sens, et l'ordre des deux bornes s'échange:
Étape 3 — relire la probabilité. Les trois manipulations ci-dessus sont des équivalences: l'événement de départ et l'événement d'arrivée sont le même événement, écrit de deux façons. Leur probabilité est donc la même, et (11.5) devient
Étape 4 — lire le résultat. Les deux bornes de (11.6) sont des fonctions des seules observations (et de , supposé connu): ce sont des statistiques. La définition (11.3) est satisfaite, et l'on a construit un intervalle de confiance de niveau exact 0,95.
Remettez dans l'ordre les étapes de la méthode du pivot.
Glissez les éléments pour les mettre dans le bon ordre
- Choisir le niveau et lire les deux quantiles qui encadrent le pivot avec cette probabilité
- Résoudre la double inégalité en isolant le paramètre au centre, en surveillant les changements de sens
- Relire la probabilité obtenue et identifier les deux bornes comme des statistiques calculables
- Trouver une fonction des données et du paramètre dont la loi ne dépend pas du paramètre
Intervalle pour une moyenne, écart-type connu
Le résultat
Démonstration. C'est exactement le calcul des étapes 1 à 4 ci-dessus, avec à la place de 1,96. Le caractère exact vient de ce que suit exactement une loi normale: une combinaison linéaire de variables normales indépendantes est normale (chapitre 7), donc sans approximation.
Les trois niveaux usuels, dont les quantiles sont obtenus par bissection sur :
| Niveau | 90 % | 95 % | 99 % |
|---|---|---|---|
| 1,6449 | 1,9600 | 2,5758 |
On retiendra le trio 1,645 · 1,96 · 2,576. La lecture de ce tableau est déjà une leçon: passer de 95 % à 99 % multiplie la demi-largeur par , soit un intervalle 31 % plus long sur le même échantillon. La fiabilité se paie en précision.
Le cas exact et le cas approché, sans les confondre
Le théorème 11.1 suppose la population normale. Que faire si elle ne l'est pas — durées de vie, montants de sinistres, comptages? Le chapitre 8 répond: le théorème central limite assure que
pourvu que la variance soit finie. L'intervalle (11.7) reste alors utilisable, mais son niveau n'est plus exact: il est approximativement , avec une erreur qui tend vers 0 quand croît.
Sur un même échantillon, on remplace le niveau 95 % par 99 %. Que devient l'intervalle de confiance pour ?
Intervalle pour une moyenne, écart-type inconnu: la loi de Student
Pourquoi on ne peut pas simplement remplacer σ par s
Dans la pratique, est presque toujours inconnu: si l'on ignore la moyenne de la production, on ignore aussi sa dispersion. La tentation est de remplacer par son estimation dans (11.7) et de continuer. Ce serait négliger que l'on a introduit une seconde source d'aléa: la quantité
a un numérateur aléatoire et un dénominateur aléatoire, alors que (11.4) n'avait qu'un numérateur aléatoire. Le rapport fluctue donc plus qu'une variable : quand tombe par hasard en dessous de , le quotient est gonflé. Utiliser 1,96 avec produirait un intervalle trop court, et un niveau réel inférieur au niveau annoncé.
Le chapitre 9 a identifié la loi exacte de (11.9) et lui a donné son nom.
Démonstration. La relation (11.10) est le théorème 9.5 du chapitre 9; rappelons-en l'argument. Sous l'hypothèse de normalité, et sont indépendantes et : c'est le théorème 9.4, au chapitre 9, dont la démonstration demande un changement de variables orthogonal en dimension (transformation de Helmert) qui n'est pas un prérequis de ce cours. Par ailleurs . Par définition de la loi de Student comme rapport de variables indépendantes,
Le se simplifie: la loi de ne dépend ni de ni de , donc est un pivot, et l'inversion des étapes 1 à 4 s'applique mot pour mot, avec à la place de .
Remarquez au passage la beauté de l'argument: la simplification de n'est pas un accident de calcul, c'est ce qui rend la méthode utilisable. Un rapport dont la loi contenait encore ne serait pas un pivot.
Pourquoi Student est plus large que la normale
La densité de Student à degrés de liberté s'écrit
Elle est symétrique et en cloche comme , mais elle décroît en puissance de et non en : ses queues sont donc beaucoup plus épaisses. Concrètement, la probabilité de dépasser 1,96 en valeur absolue, calculée par intégration numérique de (11.12), vaut pour , pour et pour , contre pour la loi normale. Pour retrouver 0,05, il faut aller plus loin: c'est exactement pourquoi dépasse 1,96.
Il y a une manière physique de comprendre l'excès de largeur. La variance de vaut pour (et elle est infinie pour ): c'est pour , pour . L'excès sur 1 est le , et il décroît comme . Autrement dit: plus l'échantillon est grand, mieux estime , moins on paie cher.
Les quantiles suivants, calculés par bissection sur la fonction de répartition de Student (bêta incomplète régularisée), montrent cette convergence:
| 5 | 10 | 20 | 30 | 60 | 120 | ||
|---|---|---|---|---|---|---|---|
| 2,5706 | 2,2281 | 2,0860 | 2,0423 | 2,0003 | 1,9799 | 1,9600 |
Démonstration. Écrivons avec et indépendants. Comme est la somme de carrés de normales centrées réduites indépendantes, d'espérance 1 chacune, la loi des grands nombres (chapitre 8) donne en probabilité, donc . Nous concluons par le , que nous utiliserons encore deux fois dans ce chapitre et qu'il vaut donc la peine d'énoncer: si et si en probabilité, étant une constante non nulle, alors — et de même pour la somme et pour le produit. Ce lemme est : sa démonstration appartient à l'étude des modes de convergence, qui n'est pas un prérequis de ce cours. Son contenu, lui, se retient sans peine: . Avec et , il donne . On peut aussi le voir directement sur la densité: pour fixé, , et la constante de normalisation tend vers .
Un laboratoire mesure 16 fois la même pièce et obtient mm et mm. Sachant que , quelle est la demi-largeur de l'intervalle de confiance à 95 % pour la moyenne?
Ce que «95 %» veut dire — et ce que cela ne veut pas dire
Le contresens
Nous venons d'obtenir . Il est presque irrésistible d'en conclure: «il y a 95 % de chances que soit entre 19,9852 et 20,0203». Cette phrase est fausse, et comprendre pourquoi est probablement l'objectif le plus important du chapitre.
Une fois l'échantillon observé, les deux bornes sont des nombres, pas des variables aléatoires: et sont écrits sur la feuille. Quant à , c'est le diamètre moyen réel de la production de la machine: un nombre lui aussi, inconnu mais parfaitement déterminé. Or l'énoncé «» est alors une affirmation sur deux nombres fixes: elle est vraie ou fausse, et rien d'autre. Sa «probabilité» vaut 1 ou 0 — on ne sait simplement pas laquelle.
Il n'y a plus aucun hasard après le tirage. Le hasard était avant: il était dans le choix des 40 pièces. C'est donc sur cet avant que porte la garantie.
La figure qui règle la question
Le mieux est de regarder la procédure à l'œuvre. Simulons 20 fois le contrôle de l'atelier: 20 échantillons indépendants de pièces, tirés d'une population dont nous fixons nous-mêmes la moyenne à mm et l'écart-type à mm. Pour chacun, on calcule , , et l'intervalle de Student à 95 %. Comme nous connaissons — privilège du simulateur, jamais du statisticien —, nous pouvons vérifier lesquels le contiennent.
Cette image dit tout. Chaque segment est un intervalle observé; il est fixe une fois tracé. La droite verticale est fixe elle aussi. Ce qui varie d'une ligne à l'autre, c'est la position et la longueur du segment — c'est-à-dire la sortie de la procédure. La garantie de 95 % est une propriété de la colonne entière de segments: en moyenne, 19 sur 20 coupent la droite.
Deux observations méritent d'être soulignées.
Un intervalle qui rate n'est pas un intervalle mal calculé. Les intervalles 5 et 11 ont été obtenus par exactement la même formule que les dix-huit autres. Ils échouent parce que leur échantillon était, par malchance, atypique. Aucune inspection de l'intervalle lui-même ne permettrait de deviner qu'il est du mauvais côté — et c'est bien pour cela qu'on ne peut rien dire de plus, après coup, qu'une confiance de 95 %.
Le nombre d'échecs est lui-même aléatoire. Sur 20 tirages, le nombre d'intervalles qui ratent suit une loi binomiale (chapitre 4), d'espérance 1. Obtenir 2 échecs n'a rien d'anormal: , et . Il aurait été plus surprenant de n'en voir aucun.
Un ingénieur calcule sur ses données l'intervalle au niveau 95 % pour une moyenne . Laquelle de ces affirmations est correcte?
Manipuler l'intervalle soi-même
L'explorateur ci-dessous reprend les 40 diamètres de l'atelier, rangés dans leur ordre de production, et calcule l'intervalle de Student sur les premières mesures, au niveau choisi. Le quantile y est calculé sur place par bissection, non lu dans une table.
L’échantillon est fixe: ce sont les 40 diamètres de l’atelier Jura Précision (données fictives), rangés dans l’ordre de production. Le curseur n ne garde que les n premières mesures; le curseur de niveau change le quantile de Student. Observez que le niveau change la largeur sans déplacer le centre, et que le quantile t tend vers 1,96 quand n grandit.
Trois choses valent d'être vérifiées à la main sur cet outil.
- Le niveau ne déplace pas le centre. Faites glisser le niveau de 80 % à 99 %: la moyenne observée affichée ne bouge pas d'un millième, seule la demi-largeur enfle. À , elle passe de 0,01131 mm à 0,02349 mm, soit un facteur 2,08.
- Le quantile tend vers 1,96. À 95 %, il vaut 2,7764 pour , 2,2622 pour , 2,0930 pour et 2,0227 pour .
- Le rétrécissement n'est pas monotone. En passant de à , la demi-largeur , parce que la vingt-sixième pièce mesurée est une pièce extrême (19,85 mm) qui fait bondir . C'est normal et instructif: la largeur de l'intervalle est elle aussi une variable aléatoire. La décroissance en est une tendance, pas une garantie échantillon par échantillon.
Intervalle pour une variance et pour un écart-type
Le pivot du khi-deux
En contrôle de qualité, la dispersion importe souvent plus que le centrage: une machine bien centrée mais irrégulière produit des rebuts des deux côtés. Il faut donc savoir encadrer et .
Le pivot est fourni, là encore, par le chapitre 9: si l'échantillon est i.i.d. de loi , alors
et cette loi ne dépend ni de ni de : est un pivot pour .
Appliquons la recette. La loi est asymétrique et vit sur : il n'y a pas de couple à prendre. L'usage est de couper dans chaque queue, c'est-à-dire de choisir et , de sorte que
Pour isoler , on passe à l'inverse. Les trois membres étant strictement positifs, l'inversion renverse les inégalités:
puis on multiplie par .
Démonstration. L'inversion ci-dessus donne (11.15). Pour l'écart-type, il suffit d'observer que est strictement croissante sur , donc l'événement est que l'événement : la probabilité est inchangée.
L'asymétrie, et ce qu'elle signifie
Pour et , on donne et . Quelle est la borne inférieure de l'intervalle de confiance à 95 % pour ?
Intervalle pour une proportion
L'intervalle de Wald
Beaucoup de questions se ramènent à une proportion inconnue : taux de rebut, part de marché, intention de vote. Le modèle est i.i.d. de loi de Bernoulli , et l'estimateur naturel est la fréquence observée
Ici, contrairement au cas de la moyenne, la variance dépend du paramètre: le pivot naturel
contient au dénominateur, et l'inversion conduirait à résoudre une équation du second degré. L'intervalle de Wald prend le raccourci: remplacer par dans le dénominateur, ce qui est légitime asymptotiquement (lemme de Slutsky, admis dans la démonstration du théorème 11.3, puisque en probabilité).
Démonstration. Le TCL appliqué aux , de variance finie, donne (11.16). Comme en probabilité et que est continue, le lemme de Slutsky (admis dans la démonstration du théorème 11.3) permet de remplacer par sans changer la loi limite. L'inversion se fait alors comme aux étapes 1 à 4, étant traité comme une constante dans le terme d'écart type.
Pourquoi l'intervalle de Wald se comporte mal
L'intervalle de Wald est le plus enseigné et l'un des plus mauvais. Ses défauts sont faciles à voir.
Il peut sortir de . Si l'on observe 1 défaut sur 20 pièces, et (11.17) donne
c'est-à-dire un intervalle contenant des proportions négatives. On le tronque d'ordinaire à 0, mais le fait qu'il ait fallu le tronquer signale que le modèle gaussien n'est pas valable ici.
Il dégénère aux extrêmes. Si l'on observe 0 défaut sur 20 pièces, , donc et l'intervalle de Wald se réduit au point : il affirme, avec 95 % de confiance, que le taux de rebut est . C'est manifestement absurde, et c'est le symptôme d'un intervalle dont la largeur est estimée par une quantité qui s'annule précisément quand on manque d'information.
Son niveau réel est nettement inférieur au niveau annoncé. Comme le nombre de succès suit une loi binomiale, on peut calculer exactement la probabilité de couverture, en sommant sur les issues possibles. Les valeurs suivantes ont été calculées ainsi, pour un niveau nominal de 95 %:
| couverture réelle de Wald | couverture réelle de Wilson | ||
|---|---|---|---|
| 20 | 0,10 | 87,6 % | 95,7 % |
| 20 | 0,50 | 95,9 % | 95,9 % |
| 50 | 0,10 | 87,9 % | 97,0 % |
| 100 | 0,10 | 93,2 % | 93,6 % |
Un intervalle annoncé à 95 % qui ne couvre en réalité que 88 % des cas n'est pas une approximation acceptable: il ment d'un facteur 2,5 sur le risque.
Sur 20 pièces contrôlées, aucune n'est défectueuse. Que vaut l'intervalle de Wald à 95 % pour le taux de rebut , et pourquoi est-ce un problème?
Intervalles unilatéraux
Jusqu'ici nous avons partagé le risque en deux moitiés égales. Ce n'est pas toujours le bon découpage. Un acheteur de câbles se moque que leur résistance soit trop élevée: il veut une garantie de plancher. Un écologue qui surveille une pollution veut un plafond. Dans ces situations, placer du côté qui n'intéresse personne est un gaspillage de précision.
La construction est identique, à ceci près qu'on ne coupe plus qu'une seule queue, et qu'on y met tout le risque . Pour une moyenne à écart-type inconnu:
Le quantile est et non : il est plus petit, donc la borne est plus serrée. Pour et , on passe de à , soit une distance à réduite de 17 %.
Déterminer la taille de l'échantillon
Le calcul, pour une moyenne
Le paramètre qu'un ingénieur contrôle vraiment, c'est . La question «combien de mesures dois-je faire?» se résout en renversant la formule de la demi-largeur. Si est connu (ou estimé par une étude pilote ou par l'historique), on veut
On arrondit au-dessus, puisque est entier et que l'inégalité doit rester vraie.
Retenez la structure de (11.20): varie comme et comme . Diviser la demi-largeur par deux coûte quatre fois plus d'observations. C'est la loi d'airain de la statistique, et elle explique pourquoi les gains de précision deviennent vite prohibitifs.
Le calcul, pour une proportion — et pourquoi mille
Pour une proportion, la variance dépend du paramètre que l'on cherche: on ne peut pas calculer sans savoir . La sortie est élégante. La fonction est une parabole renversée, maximale en , où elle vaut . En prenant ce pire cas, on obtient une taille qui convient quelle que soit la valeur réelle de :
À 95 %, , d'où la règle de poche universelle
Le tableau suivant donne les tailles minimales, calculées par (11.21) et arrondies à l'entier supérieur:
| Demi-largeur visée | Niveau 95 % | Niveau 99 % |
|---|---|---|
| 1 point (0,01) | 9 604 | 16 588 |
| 2 points (0,02) | 2 401 | 4 147 |
| 3 points (0,03) | 1 068 | 1 844 |
| 5 points (0,05) | 385 | 664 |
Ce tableau est la réponse à la question «pourquoi les sondages interrogent-ils environ mille personnes?». Mille, c'est le point où la courbe de la figure 11.3 s'aplatit: on y achète une marge de 3,1 points, ce qui suffit pour la plupart des commentaires politiques. Descendre à 1 point exigerait 9 604 personnes, soit presque dix fois le coût pour un gain de 2 points; et cette précision supplémentaire serait de toute façon illusoire, car elle deviendrait plus petite que les biais de non-réponse et de recrutement, qui ne diminuent pas avec . Mille est donc un optimum économique, pas une constante mathématique.
Notez enfin que n'apparaît nulle part relativement à la taille de la population: interroger 1 000 personnes donne la même précision dans un pays de neuf millions d'habitants que dans un pays de trois cents millions. Ce résultat contre-intuitif vient de ce que ne fait pas intervenir la taille de la population — sauf, par une correction de population finie, lorsque l'échantillon en représente une fraction non négligeable, ce qui n'est jamais le cas dans un sondage national.
Combien de personnes faut-il interroger pour obtenir une marge d'erreur d'au plus 2 points au niveau 95 %, dans le cas le plus défavorable?
Intervalle pour la différence de deux moyennes
Comparer deux machines, deux traitements, deux fournisseurs est la question la plus fréquente de la statistique appliquée. Le paramètre d'intérêt devient .
Soient deux échantillons indépendants, de loi et de loi , de inconnue. Alors est d'espérance et, les échantillons étant indépendants, les variances s'ajoutent (chapitre 7):
On estime en mettant en commun les deux dispersions, chacune pondérée par ses degrés de liberté — c'est la variance combinée («pooled»):
Démonstration (esquisse). est normale, suit un comme somme de deux khi-deux indépendants (additivité des degrés de liberté, chapitre 9), et les deux sont indépendantes. Le rapport est donc un Student à degrés de liberté, et l'inversion est celle du théorème 11.2.
Lorsque les variances ne peuvent pas être supposées égales, on utilise la construction de Welch, qui remplace par et le nombre de degrés de liberté par une valeur fractionnaire calculée à partir des données. Elle est présentée au chapitre 12; sur les données ci-dessus, elle donne pratiquement le même résultat, les deux dispersions étant quasi identiques.
La dualité avec les tests d'hypothèses
Revenons à (11.13): l'intervalle de l'atelier, , contient la valeur nominale 20,00. Nous en avons tiré la conclusion prudente: «rien n'oblige à conclure au déréglage». Cette phrase est déjà une décision, et elle a une traduction exacte en termes de test.
Reprenons la définition de l'intervalle. Une valeur appartient à l'intervalle (11.11) si et seulement si
Le membre de gauche est ce que le chapitre 12 appellera la statistique de test de l'hypothèse , et le membre de droite sa valeur critique. Autrement dit:
L'intervalle de confiance de niveau est exactement l'ensemble des valeurs que le test bilatéral de niveau ne rejette pas.
Cette équivalence, valable bien au-delà du cas de la moyenne, a trois conséquences pratiques.
Un intervalle contient plus d'information qu'un test. Le test répond par oui ou par non à une question (?); l'intervalle répond simultanément à toutes les questions de cette forme, et il donne en outre l'ordre de grandeur des écarts compatibles avec les données. Sur l'atelier: non seulement 20,00 n'est pas rejeté, mais aucun déréglage supérieur à 0,018 mm n'est compatible avec les mesures. Un simple «non rejeté» aurait perdu cette information.
Un intervalle protège contre la confusion entre significatif et important. Un écart minuscule peut être «significatif» si est gigantesque; l'intervalle le montre immédiatement, en étant à la fois très court et très proche de zéro. Inversement, un test non significatif sur un très petit échantillon produit un intervalle si long qu'il rend visible l'absence d'information — là où «non rejeté» pourrait être lu, à tort, comme «pas d'effet».
Le sens du risque est le même. Les 5 % de l'intervalle qui ratent à la figure 11.2 sont exactement les 5 % de risque de première espèce du test: rejeter à tort une valeur vraie. Le chapitre 12 leur donnera un nom, , leur adjoindra le risque de seconde espèce , et construira la notion de puissance, qui n'a pas d'équivalent direct dans le langage des intervalles.
C'est là que nous reprendrons: le chapitre 12 formalise les hypothèses, la région de rejet, la valeur et la puissance, et il retrouvera, sur les mêmes données de l'atelier, les conclusions que nous venons de lire dans les intervalles.
Synthèse
- Une estimation ponctuelle sans mesure d'incertitude est une information incomplète; un intervalle de confiance de niveau est un intervalle aléatoire dont la probabilité de contenir le paramètre vaut , pour toute valeur du paramètre.
- La méthode du pivot construit tous ces intervalles: trouver une fonction des données et du paramètre dont la loi ne dépend pas du paramètre, l'encadrer par deux quantiles, puis résoudre la double inégalité en surveillant les changements de sens.
- Pour une moyenne: si est connu (exact sous normalité, approché par le TCL sinon), et si est inconnu. La loi de Student est plus étalée que la normale parce qu'on paie l'estimation de ; l'excédent décroît en et .
Dans l'écriture , qu'est-ce qui est aléatoire?
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Une remplisseuse de sachets est réglée pour un contenu nominal de 500 g. Son écart-type est connu et stable, g (données fictives). Un contrôle de sachets donne g. On admet que la masse suit une loi normale.
- Construisez l'intervalle de confiance à 95 % pour la masse moyenne .
Douze résistances issues d'un même lot sont mesurées (données fictives, en ohms):
248,1 251,3 249,6 252,0 247,8 250,4
249,1 253,2 250,8 248,9 251,6 250,2
On admet que la résistance suit une loi normale. On donne et .
Sur visiteurs d'un site interrogés à la sortie, 84 déclarent avoir trouvé ce qu'ils cherchaient (données fictives).
- Vérifiez les conditions d'emploi et donnez l'intervalle de Wald à 95 % pour la proportion de visiteurs satisfaits.
- Calculez l'intervalle de Wilson (11.18) et comparez.
- On refait l'étude sur 20 visiteurs seulement, dont 1 satisfait. Que donnent les deux intervalles? Concluez.
Solution
1. . Conditions: et — largement remplies. L'erreur type vaut
Reprenez les douze mesures de résistance de l'exercice 11.2, pour lesquelles . On donne et .
Un institut interroge personnes; 520 se déclarent favorables à une proposition (données fictives).
- Donnez l'intervalle de Wald à 95 % pour et dites si la proposition peut être déclarée majoritaire.
- L'institut ne s'intéresse qu'à la question « dépasse-t-il 50 %?». Construisez la borne inférieure de confiance unilatérale à 95 % et concluez.
- Combien de personnes faudrait-il interroger pour ramener la marge d'erreur bilatérale à 1 point? Commentez la décision de l'institut.
- En utilisant la dualité de la dernière section, dites quelles hypothèses un test bilatéral au niveau 5 % rejetterait.
Références
- Ross, S. M., Initiation aux probabilités, PPUR — chapitres sur l'estimation par intervalles, dans la traduction utilisée à l'EPFL.
- Wackerly, D., Mendenhall, W. & Scheaffer, R., Mathematical Statistics with Applications, Cengage — la méthode du pivot y est exposée sous le nom de pivotal method, avec de nombreux exemples.
- Morgenthaler, S., Introduction à la statistique, PPUR — intervalles de confiance et dualité avec les tests, dans une présentation proche de celle de ce chapitre.
- Saporta, G., Probabilités, analyse des données et statistique, Technip — tables et intervalles pour la variance et la proportion.
- Rice, J. A., Mathematical Statistics and Data Analysis, Duxbury — discussion de la couverture réelle des intervalles pour une proportion et de l'intervalle du score.
- Dodge, Y., Statistique — dictionnaire encyclopédique, Springer — entrées «intervalle de confiance», «niveau de confiance» et «intervalle de Wilson».