Effectifs, histogrammes, moyenne, médiane et quartiles, écart-type, boîte à moustaches, échantillon aléatoire et lois d'échantillonnage.
Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
distinguer la démarche probabiliste, qui va du modèle aux données, de la démarche statistique, qui va des données au modèle, et situer les chapitres 9 à 12 dans cette seconde démarche;
reconnaître le type d'un caractère (qualitatif nominal ou ordinal, quantitatif discret ou continu) et en déduire le tableau, le graphique et les résumés licites;
construire un tableau d'effectifs et de fréquences, choisir une largeur de classe et tracer un histogramme correct, y compris lorsque les classes sont inégales;
calculer et interpréter les indicateurs de position (moyenne, médiane, mode, quantiles) et de dispersion (étendue, écart interquartile, variance, écart-type, coefficient de variation), et discuter leur sensibilité aux valeurs extrêmes;
construire et lire une boîte à moustaches selon la règle des 1,5 écarts interquartiles, et décrire l'asymétrie d'une distribution;
formuler le modèle de l'échantillon aléatoire simple, distinguer l'estimateur Xˉn de l'estimation xˉn, et énoncer les lois d'échantillonnage de et de qui serviront aux chapitres 10 à 12.
Xˉn
Sn2
Du modèle aux données: le sens de la marche s'inverse
Deux démarches symétriques
Les huit premiers chapitres ont construit un outillage probabiliste. À chaque fois, le point de départ était un modèle — une urne, un dé équilibré, une loi B(n,p), une loi N(μ,σ2) dont les paramètres étaient donnés — et la question était: que vont produire les données? Le chapitre 4 calculait P(X=k) pour une binomiale connue; le chapitre 6 calculait P(a≤X≤b) pour une normale de paramètres connus; le chapitre 8 décrivait le comportement de la moyenne de n tirages d'une loi connue.
La statistique inverse la flèche. On dispose maintenant de données — quarante diamètres mesurés, mille réponses à un sondage, trente durées de vie — et le modèle est inconnu. On veut, à partir de ces données:
les résumer honnêtement, c'est-à-dire les remplacer par quelques nombres et quelques images sans les trahir: c'est la statistique descriptive, l'objet de la première moitié de ce chapitre;
estimer les paramètres du modèle qui les a produites: c'est l'estimation ponctuelle, chapitre 10;
quantifier l'incertitude de cette estimation: c'est l'intervalle de confiance, chapitre 11;
trancher entre deux hypothèses concurrentes en contrôlant le risque de se tromper: c'est le test d'hypothèses, chapitre 12.
La statistique descriptive et la statistique inférentielle ne diffèrent donc pas par les calculs — on calcule la même moyenne — mais par la portée de ce qu'on en dit. Dire «la moyenne des quarante pièces mesurées est 20,003 mm» est une description: c'est vrai, exactement, et sans hypothèse. Dire «le diamètre moyen produit par cette machine vaut 20,003 mm» est une inférence: c'est une affirmation sur une population qu'on n'a pas observée, et elle ne peut être ni certaine ni dépourvue d'hypothèses. Toute la seconde moitié du cours consiste à rendre ce deuxième énoncé défendable, en lui accolant une marge et un risque.
Le fil rouge: l'atelier d'usinage «Jura Précision»
Un même jeu de données parcourra les chapitres 9 à 12. Un atelier d'usinage jurassien produit des axes de diamètre nominal 20,00 mm; le bureau des méthodes a fixé l'intervalle de tolérance[19,90;20,10] mm, en dehors duquel la pièce est rebutée. Pour contrôler la machine A, on prélève n=40 pièces et on mesure leur diamètre au micromètre, au centième de millimètre.
Voici les 40 mesures, en millimètres, rangées par ordre croissant:
19,85
19,87
19,88
19,93
19,94
19,96
19,96
19,96
19,96
19,97
19,98
19,98
19,98
19,99
19,99
19,99
20,01
20,01
20,01
20,01
20,01
20,02
20,02
20,03
20,03
20,03
20,04
20,04
20,04
20,04
20,04
20,04
20,05
20,05
20,05
20,05
20,06
20,07
20,08
20,09
Quarante nombres ne se lisent pas. Même rangés, ils ne répondent à aucune des questions que se pose le chef d'atelier: la machine est-elle centrée sur 20,00? disperse-t-elle trop? combien de rebuts faut-il prévoir? Le travail du chapitre est de transformer ce tableau en trois ou quatre nombres et deux images qui, elles, répondent.
Population, échantillon, individu, caractère
Le vocabulaire
Dans l'atelier, la population est l'ensemble des axes que la machine A produit dans les conditions de réglage du jour — un ensemble qu'on peut considérer comme indéfiniment grand, puisque la machine pourrait continuer à tourner; l'individu est une pièce; l'échantillon est constitué des 40 pièces prélevées; le caractère est le diamètre, exprimé en millimètres.
Deux remarques valent d'être faites tout de suite. D'abord, la population est définie par l'étude, pas par la nature: si le réglage change à midi, la population du matin et celle de l'après-midi sont deux populations distinctes, et mélanger les deux échantillons produirait une image trompeuse. Ensuite, une population n'a pas besoin d'exister physiquement en entier: la «population des axes produits par cette machine à ce réglage» est en partie virtuelle, et c'est le cas le plus fréquent en contrôle industriel comme en sciences expérimentales.
Les types de caractères
La distinction qui gouverne tout le reste est celle-ci: le type du caractère décide du tableau, du graphique et du résumé qui ont un sens. Appliquer une moyenne à un caractère qui n'en supporte pas est la faute la plus commune, et elle produit des nombres qui ont l'air de vouloir dire quelque chose.
Ce que chaque type autorise:
Type
Tableau
Graphique
Position
Dispersion
Qualitatif nominal
effectifs et fréquences par modalité
diagramme en barres, camembert
mode
aucune (indice de diversité)
Qualitatif ordinal
effectifs, fréquences, cumuls
barres ordonnées
mode, médiane, quantiles
écart interquartile (en rangs)
Quantitatif discret
effectifs par valeur
diagramme en bâtons
mode, médiane, moyenne
étendue, écart-type
Quantitatif continu
effectifs par classe
histogramme, polygone des fréquences cumulées
médiane, moyenne, quantiles
étendue, EIQ, écart-type
Trois conséquences pratiques. Un caractère nominal n'a pas de médiane: la médiane suppose de ranger les individus, et on ne range pas des cantons. Un caractère ordinal a une médiane mais pas de moyenne: la moyenne d'un satisfaction codée 1 à 5 n'a de sens que si l'on postule que passer de 1 à 2 «vaut» autant que passer de 4 à 5 — postulat rarement défendable, et jamais vérifié par le codage lui-même. Enfin, un caractère continu ne se tabule pas valeur par valeur: les 40 diamètres ne prennent que 18 valeurs distinctes ici seulement parce que le micromètre arrondit au centième; avec un appareil plus fin, toutes les valeurs seraient distinctes et le tableau des effectifs ne dirait plus rien. D'où les classes.
Question 9.1
Une enquête relève, pour chaque employé: le service (production, vente, administration), l'ancienneté en années, le niveau de satisfaction (insatisfait, neutre, satisfait) et le nombre de jours d'absence de l'année. Quel est le seul de ces quatre caractères pour lequel la moyenne arithmétique n'a manifestement aucun sens, alors que la médiane en a un?
Tableaux d'effectifs, classes et histogramme
Effectifs, fréquences et cumuls
La somme des fréquences vaut 1: c'est la première vérification à faire sur tout tableau, et elle attrape la plupart des erreurs de comptage. Nous l'écrirons systématiquement.
Le choix des classes
Pour un caractère continu, on partitionne l'étendue des valeurs en classes[a0,a1[,[a1,a2[,… — traditionnellement fermées à gauche et ouvertes à droite, de sorte qu'aucune valeur ne tombe dans deux classes. Le choix de la largeur h et de l'origine a0 n'est dicté par aucune loi; deux repères usuels aident à le faire:
la règle de Sturges: k≈1+log2n classes, soit k≈6,3 pour n=40;
la règle de la racine: k≈n, soit k≈6,3 également ici.
L'étendue des diamètres vaut 20,09−19,85=0,24 mm; une largeur h=0,05 mm donne 5 classes. Nous la retenons pour une raison qui n'est pas arithmétique mais métier: elle fait coïncider les bords de classes avec les deux limites de tolérance 19,90 et 20,10 mm. Un découpage qui aligne les classes sur les seuils de décision se lit sans calcul.
L'histogramme, et le piège des classes inégales
Lorsque toutes les classes ont la même largeur, hi=h est constant et la hauteur fi/h est proportionnelle à fi: on peut alors porter directement les effectifs en ordonnée, et c'est ce que fait la figure 9.1. Mais dès que les largeurs diffèrent, porter l'effectif en hauteur falsifie la figure.
Figure 9.1. Histogramme des 40 diamètres de l'échantillon A de l'atelier Jura Précision (données fictives), en classes de 0,05 mm. La ligne tiretée marque la moyenne, 20,003 mm; la ligne bleue pointillée la médiane, 20,01 mm. La moyenne est à gauche de la médiane: elle est tirée vers le bas par la queue de gauche. Les deux traits bruns verticaux sont les limites de tolérance 19,90 et 20,10 mm; la classe la plus à gauche, entièrement hors tolérance, contient les trois pièces rebutées.
La forme se lit d'un coup d'œil: un mode franc juste au-dessus du nominal, une chute rapide à droite, une queue plus longue à gauche. C'est cette dissymétrie qui explique que la moyenne soit inférieure à la médiane, et c'est elle qui produit les trois rebuts. Une machine parfaitement centrée et symétrique avec le même écart-type produirait des rebuts des deux côtés, en nombre à peu près égal.
La largeur de classe change l'image, pas les données
Explorateur 9.1 · Explorateur — la largeur de classe change l'image, pas les statistiques
Les 40 diamètres de l'échantillon A (données fictives) regroupés en classes de largeur h à partir d'une origine que vous choisissez. L'histogramme se reconstruit à chaque mouvement; la moyenne, la médiane et l'écart-type, eux, sont calculés sur les données brutes et ne bougent pas.
Largeur de classe h0,05mm
Origine des classes a019,850mm
Nombre de classes non vides
5
Effectif de la classe modale
16
Moyenne x̄ (invariante)
20,00275mm
Médiane (invariante)
20,01mm
Écart-type s (invariant)
0,054865mm
Étendue (invariante)
0,24mm
Faites varier la largeur h de 0,01 à 0,10 mm et déplacez l'origine du découpage. L'histogramme passe d'un peigne illisible, où chaque valeur du micromètre forme sa propre barre, à trois gros blocs qui écrasent toute la structure; entre les deux, autour de h=0,04 à 0,05 mm, la forme réelle apparaît. Déplacer seulement l'origine, à largeur fixée, suffit parfois à faire naître ou disparaître un second sommet: un mode secondaire visible pour un seul découpage n'est pas un résultat.
Pendant ce temps, les trois derniers cadrans ne bougent pas d'un chiffre: la moyenne reste 20,00275, la médiane 20,01, l'écart-type 0,054865. C'est la leçon de l'explorateur, et elle vaut d'être formulée: l'histogramme est une représentation, avec sa part d'arbitraire; les indicateurs numériques sont des fonctions des données, et ils ne dépendent d'aucun choix de l'analyste. Quand une figure et un nombre se contredisent, c'est la figure qu'il faut refaire.
Question 9.2
Une enquête de l'atelier regroupe 200 durées d'intervention en trois classes: [0;10[ min avec 40 interventions, [10;20[ min avec 90, et [20;50[ min avec 70. Quelle hauteur faut-il donner au rectangle de la dernière classe dans un histogramme des fréquences, c'est-à-dire quelle est sa densité de fréquence par minute?
Indicateurs de position
Moyenne arithmétique
Trois propriétés à retenir, toutes de vérification immédiate:
La somme des écarts à la moyenne est nulle: ∑i(xi−xˉ)=∑ixi−nxˉ=0. La moyenne est le point d'équilibre de la série — son centre de gravité, exactement comme l'espérance au chapitre 3.
Linéarité: si yi=axi+b, alors yˉ=axˉ+b. Changer d'unité ou d'origine change la moyenne de la même façon.
Minimisation: la fonction t↦∑i(xi−t)2 atteint son minimum en t=xˉ — la moyenne est la valeur qui rend la somme des carrés des écarts la plus petite possible. (Dérivez: donne .) Nous verrons que la médiane joue le même rôle pour la somme des des écarts.
Pour l'échantillon A, la somme des 40 diamètres vaut 800,11 mm, d'où
xˉA=40800,11=20,00275 mm,
que l'on arrondira à 20,003 mm pour l'énoncer. Nous conservons la valeur non arrondie dans tous les calculs intermédiaires et n'arrondissons qu'au moment d'écrire un résultat: arrondir en cours de route sur une variance se paie très cher.
Médiane, mode, quantiles
La définition (9.4) est celle que ce cours utilisera partout. Elle se lit ainsi: le quantile d'ordre p est une valeur qui coupe la série en laissant au moins la proportion p des observations à sa gauche et au moins 1−p à sa droite; quand plusieurs valeurs conviennent, on prend le milieu de l'intervalle. La médiane est donc la valeur centrale pour n impair, et la demi-somme des deux valeurs centrales pour n pair.
Pour l'échantillon A, n=40:
np=10 pour p=0,25: Q1=2x(10)+x(11)=219,97+19,98=19,975 mm;
np=20 pour p=0,5: Me=2x(20)+x(21)=220,01+20,01=20,01 mm;
np=30 pour p=0,75: Q3=2x(30)+x(31)=220,04+20,04=20,04 mm.
Le mode se lit sur la série brute: la valeur 20,04 apparaît six fois, plus que toute autre. Sur la série groupée, la classe modale est [20,00;20,05[.
Résistance: la moyenne cède, la médiane tient
Voici la raison pour laquelle on donne presque toujours les deux.
Question 9.3
Remettez dans l'ordre les étapes du calcul de la médiane d'une série de n valeurs numériques.
Glissez les éléments pour les mettre dans le bon ordre
1.
Vérifier que le caractère est au moins ordinal
2.
Si ce produit est entier, prendre la demi-somme des valeurs de rangs n/2 et n/2+1; sinon prendre la valeur de rang ⌈n/2⌉
3.
Calculer le produit n×0,5
4.
Comparer la médiane obtenue à la moyenne pour diagnostiquer l'asymétrie
5.
Ranger les n valeurs par ordre croissant
Indicateurs de dispersion
Deux séries peuvent avoir la même moyenne et n'avoir rien à voir. Un axe usiné à 20,00±0,01 mm et un axe usiné à 20,00±0,20 mm ont la même position et des destins opposés: le second remplit la benne à rebuts. La dispersion n'est pas un complément de la position, c'est la moitié de l'information.
Étendue et écart interquartile
Pour l'échantillon A: e=20,09−19,85=0,24 mm et EIQ=20,04−19,975=0,065 mm. L'étendue est le plus simple des indicateurs et le plus fragile: elle ne dépend que des deux valeurs extrêmes, donc elle est déterminée par les deux observations les moins fiables, et elle croît mécaniquement avec n (plus on mesure de pièces, plus on a de chances d'en rencontrer une extrême). L'écart interquartile est au contraire robuste, pour la même raison que la médiane, et c'est lui qui donne sa largeur à la boîte du paragraphe suivant.
Variance et écart-type
Le calcul direct de (9.5) demande deux passages sur les données. La formule suivante, dite de König–Huygens (c'est l'analogue empirique de Var(X)=E[X2]−E[X]2 du chapitre 3), n'en demande qu'un:
i=1∑n(xi−xˉ)2=i=1∑nxi2−nxˉ2.(9.6)
Démonstration. En développant le carré, ∑i(xi−xˉ)2=∑ixi2−2xˉ∑ixi+nxˉ2, et ∑ixi=nxˉ, d'où ∑ixi2−2nxˉ2+nxˉ2=∑ixi2−nxˉ2. □
Question 9.4
On mesure les mêmes 40 pièces, mais on décide d'exprimer l'écart au nominal en micromètres: yi=(xi−20,00)×1000. Que deviennent la moyenne et l'écart-type?
Boîte à moustaches et forme de la distribution
La construction, énoncée précisément
Deux erreurs sont fréquentes et se voient tout de suite sur une figure: faire aller les moustaches jusqu'aux barrières (elles s'arrêtent à des valeurs observées, et sont donc de longueurs inégales), et faire aller les moustaches jusqu'au minimum et au maximum sans marquer les points atypiques (on perd alors précisément l'information que la boîte est faite pour donner).
Le coefficient 1,5 n'a rien de sacré. Il vient de Tukey, qui l'a choisi parce que pour une population normale environ 0,7% des observations tombent au-delà des barrières: sur n=40 pièces normales, on s'attend à 0,28 point atypique, donc en général aucun. Un point signalé par la boîte n'est donc pas une erreur de mesure: c'est une observation dont la position mérite qu'on aille voir. Le supprimer sans raison est une faute; ne pas le regarder en est une autre.
Figure 9.2. Boîtes à moustaches des échantillons A (en haut, machine A, n = 40) et B (en bleu, machine B, n = 30) sur un axe commun, en millimètres. Les boîtes vont du premier au troisième quartile, le trait épais marque la médiane, les moustaches s'arrêtent à la dernière valeur observée à l'intérieur des barrières de 1,5 écart interquartile. Les deux points isolés à gauche de la boîte A sont les pièces à 19,85 et 19,87 mm; l'échantillon B n'a aucune valeur atypique.
Asymétrie et forme
La boîte donne trois indices de forme, lisibles sans calcul: la position du trait médian dans la boîte, la longueur relative des deux moustaches, et le côté où se trouvent les points atypiques. Une distribution symétrique a la médiane au milieu de la boîte et deux moustaches de même longueur. Une distribution étalée à droite (asymétrie positive) a la médiane décalée vers la gauche de la boîte et une moustache droite plus longue: c'est la forme de presque toutes les durées, de tous les revenus, de toutes les tailles de fichiers. Une distribution étalée à gauche a le profil inverse.
On peut chiffrer cette impression. Le coefficient d'asymétrie (skewness) d'une série est le moment centré d'ordre trois réduit:
Le cube conserve le signe des écarts: une queue à droite fournit de grands écarts positifs au cube, donc g1>0; une queue à gauche donne g1<0; une distribution symétrique donne g1=0. Sur nos deux échantillons: g1(A)=−0,999 et g1(B)=+0,014. L'échantillon A est nettement étalé vers la gauche — un écart-type d'asymétrie, entièrement produit par les trois pièces trop petites —, l'échantillon B est pratiquement symétrique.
Un dernier mot sur le vocabulaire des formes. On dit une distribution unimodale si elle a un seul sommet, bimodale si elle en a deux — et une distribution bimodale nette signale presque toujours un mélange de deux populations qu'il fallait séparer (deux machines, deux équipes, deux lots de matière). On parle enfin d'aplatissement (kurtosis) pour l'épaisseur des queues, un quatrième moment que nous n'utiliserons pas dans ce cours.
Question 9.5
Douze interventions de maintenance ont duré, en minutes: 4, 5, 5, 6, 7, 7, 7, 8, 9, 10, 12, 18. Calculez l'écart interquartile avec la convention (9.4) du cours.
De la description à l'inférence: le modèle de l'échantillon
Tout ce qui précède est du calcul sur quarante nombres et ne suppose rien. Nous voulons maintenant dire quelque chose de la machine, pas seulement des quarante pièces. Pour cela, il faut un modèle probabiliste, et il tient en une phrase.
Les deux hypothèses méritent qu'on les pèse. Même loi signifie que la machine ne dérive pas pendant le prélèvement: si l'outil s'use et que le diamètre augmente de pièce en pièce, la troisième et la trente-huitième n'ont pas la même loi, et tout ce qui suit s'écroule. Indépendance signifie que le diamètre d'une pièce ne renseigne pas sur celui de la suivante: c'est raisonnable si l'on prélève au hasard dans un bac, douteux si l'on prélève quarante pièces consécutives à la sortie de la machine, et faux si un copeau bloqué affecte une série de pièces d'affilée. En pratique, on obtient l'indépendance par la méthode de prélèvement — tirage au hasard dans la production d'une période —, jamais par décret.
Une manière imagée de se représenter la loi d'échantillonnage: imaginons que l'atelier prélève, non pas un échantillon de 40 pièces, mais mille échantillons de 40 pièces, et calcule mille moyennes. Ces mille nombres formeraient une série, avec sa propre moyenne, sa propre dispersion, sa propre forme. La loi d'échantillonnage de Xˉ40 est la loi limite de cette série lorsqu'on répète l'opération indéfiniment. Elle existe que l'on fasse ou non l'expérience — et le paragraphe suivant la calcule exactement, sans rien prélever du tout.
Lois d'échantillonnage
Espérance et variance de la moyenne empirique
Démonstration. L'espérance est linéaire (chapitre 3), sans aucune hypothèse d'indépendance:
E[Xˉn]=E[n1i=1∑nXi]=n1i=1∑nE[Xi]=n1nμ=μ.
Pour la variance, Var(aX)=a2Var(X) et, les Xi étant indépendantes donc non corrélées, la variance d'une somme est la somme des variances (chapitre 7):
Lisez bien où l'indépendance a servi et où elle n'a pas servi: E[Xˉn]=μ ne demande rien, la formule de la variance demande seulement que les Xi soient non corrélées. C'est important en pratique: un prélèvement légèrement dépendant ne déplace pas le centre, mais il fausse la précision — et il la fausse presque toujours dans le mauvais sens, en la surestimant.
La formule σ/n est le nombre le plus utile de tout le cours de statistique. Elle dit que la précision d'une moyenne s'améliore comme la racine carrée de l'effort: quadrupler la taille de l'échantillon divise l'erreur type par 2, la centupler la divise par 10. Pour l'atelier, avec σ≈0,055 mm:
n
1
4
16
40
64
121
σ/n (mm)
0,0550
0,0275
0,0138
0,0087
0,0069
0,0050
Figure 9.3. Densité d'une pièce isolée et densités de la moyenne empirique pour n = 4, 16 et 64, toutes centrées sur 20,00 mm et tracées sur le même axe. La courbe la plus large et la plus plate est celle d'une pièce; viennent ensuite, de plus en plus étroites et hautes, n = 4 (en brun), n = 16 (en bleu) et n = 64, la plus haute. La largeur est divisée par la racine carrée de n: passer de 1 à 64 pièces divise l'écart-type par 8, et multiplie donc le sommet par 8.
La loi exacte dans le cas normal, la loi approchée sinon
Démonstration. Le point 1 résulte de la stabilité de la loi normale par combinaison linéaire (chapitre 6): une somme de variables normales indépendantes est normale, et le théorème 9.1 donne ses deux paramètres. Le point 2 est exactement le théorème central limite du chapitre 8, réécrit avec la notation Xˉn. □
Le point 1 mérite d'être savouré: dans le cas normal, il n'y a aucune approximation et aucune condition sur n. La moyenne de deux pièces normales est normale. Le point 2 en revanche est une limite, et «assez grand» dépend de la loi de départ: n≥30 est la règle d'atelier usuelle, mais elle est optimiste pour une loi très asymétrique (une exponentielle demande plutôt n≥50) et beaucoup trop prudente pour une loi déjà presque symétrique (une uniforme donne une excellente approximation dès n=5). Le chapitre 8 discute ces ordres de grandeur.
La variance empirique est sans biais
Démonstration. L'identité algébrique de départ est une décomposition de la somme des carrés autour de μ:
le double produit 2(Xˉn−μ)∑i(Xi−Xˉn) étant nul puisque ∑i(Xi−Xˉn)=0. On en tire
i=1∑n(Xi−Xˉn)2=i=1∑n(Xi−μ)2−n(Xˉn−μ)2.
Prenons l'espérance des deux membres. À gauche rien à faire; à droite, E[(Xi−μ)2]=Var(Xi)=σ2 pour chaque i, et E[(Xˉn−μ)2]=Var(Xˉn)=σ2/n par le théorème 9.1, puisque E[Xˉn]=μ. Donc
E[i=1∑n(Xi−Xˉn)2]=nσ2−n⋅nσ2=(n−1)σ2,
et en divisant par n−1 on obtient E[Sn2]=σ2. □
La démonstration montre d'où vient le n−1: la somme des carrés autour de Xˉn est en moyenne plus petite que celle autour de μ, exactement de n⋅σ2/n=σ2, c'est-à-dire d'un σ2, c'est-à-dire d'un terme sur n. On dit qu'on a «perdu un degré de liberté» en estimant μ par Xˉn: les n écarts Xi−Xˉn sont liés par une relation (leur somme est nulle), il n'y en a donc que n−1 de libres. Cette comptabilité des degrés de liberté gouvernera tout le reste du cours.
Le cas normal: khi-deux, indépendance, Student
Les résultats précédents ne supposent rien sur la forme de la loi. Si l'on ajoute l'hypothèse de normalité, on obtient beaucoup plus: la loi exacte de Sn2, et surtout la loi exacte du rapport qui servira aux chapitres 11 et 12.
Admis. Les deux affirmations demandent un changement de variables orthogonal en dimension n (une transformation de Helmert) et le calcul du jacobien associé, outils d'algèbre linéaire et de calcul intégral à plusieurs variables qui dépassent le cadre de ce cours. Voici toutefois la raison, qui elle est compréhensible. Écrivons
i=1∑n(σXi−μ)2=autour de Xˉnσ2(n−1)Sn2+position de Xˉn(σ/nXˉn−μ)2,
qui n'est autre que l'identité de la démonstration du théorème 9.3, divisée par σ2. Le membre de gauche est une somme de n carrés de normales centrées réduites indépendantes, donc un χn2. Le second terme de droite est le carré d'une N(0,1) par (9.9), donc un χ12. Si l'on admet que les deux termes de droite sont indépendants, l'additivité des degrés de liberté du khi-deux impose que le premier soit un χn−12: il reste n−1 degrés de liberté une fois qu'on en a dépensé un pour localiser Xˉn.
Quant à l'indépendance elle-même, elle est propre à la loi normale et elle n'a rien d'évident — Sn2 est calculée à partir des mêmes données que Xˉn. On peut la rendre plausible ainsi: Xˉn est la projection du vecteur (X1,…,Xn) sur la direction (1,1,…,1), et (n−1)Sn2 est le carré de la norme de ce qu'il en reste, c'est-à-dire de sa projection sur l'hyperplan orthogonal. Or un vecteur gaussien de composantes indépendantes et de même variance a une loi invariante par rotation, donc ses projections sur deux sous-espaces orthogonaux sont indépendantes. Aucune autre famille de lois n'a cette propriété. □
Démonstration. Divisons numérateur et dénominateur par σ/n:
où Z∼N(0,1) par (9.9). Le radicande est C/(n−1) avec C=(n−1)Sn2/σ2∼χn−12 par (9.12), et Z et C sont indépendantes puisque Xˉn et Sn2 le sont. La définition (9.13) avec ν=n−1 conclut. □
C'est le théorème qui rend la statistique praticable. Sans lui, la quantité (Xˉn−μ)/(σ/n) est bien normale, mais elle contient σ, que l'on ne connaît jamais. En remplaçant σ par Sn, on introduit une seconde source d'aléa — le dénominateur devient lui aussi une variable aléatoire — et la loi cesse d'être normale: elle s'épaissit aux extrémités, exactement de ce qu'il faut. Numériquement, sur nos données, t39;0,975=2,0227 au lieu de z0,975=1,9600: la marge à payer pour ignorer σ est ici de 3,2%. C'est ce nombre qui produira, au chapitre 11, l'intervalle de confiance [19,9852;20,0203] pour le centrage de la machine A.
Quand ν croît, Sn se concentre autour de σ, le dénominateur de (9.13) tend vers 1 et la loi de Student tend vers la normale:
ν
1
2
5
10
20
30
39
60
120
∞
tν;0,975
12,706
4,303
2,571
2,228
2,086
2,042
2,023
2,000
1,980
1,960
La convergence est lente au début et rapide ensuite: au-delà de ν=30, l'écart à 1,960 est inférieur à 5%, ce qui justifie la vieille règle «grand échantillon: on peut prendre 1,96». Pour ν=1 en revanche, la loi de Student est la loi de Cauchy, qui n'a même pas d'espérance: deux observations ne permettent pas grand-chose.
Question 9.6
On prélève un échantillon aléatoire simple de taille n=25 dans une population normale d'écart-type σ inconnu. Laquelle de ces affirmations est exacte?
Les trois lois dérivées de la normale
Les chapitres 10 à 12 n'utiliseront, en plus de la normale, que trois lois. Toutes trois se déduisent de variables normales indépendantes, toutes trois se lisent dans des tables (annexe A), et toutes trois portent un ou deux degrés de liberté qui sont, à chaque fois, le nombre d'informations libres restantes.
Le khi-deux χν2, somme de ν carrés de normales centrées réduites indépendantes. Elle vit sur [0,+∞[, elle est fortement asymétrique à droite pour ν petit et se symétrise quand ν grandit; son espérance est ν, sa variance 2ν, et son mode vaut ν−2 pour ν≥2. Sa densité est
fν(x)=2ν/2Γ(ν/2)1xν/2−1e−x/2,x>0.
Elle sert aux inférences sur une variance (chapitre 11), aux tests d'ajustement et d'indépendance (chapitre 12). Repères: χ5;0,952=11,070, χ39;0,0252=23,654 et χ39;0,9752=58,120 — notez que ces deux dernières valeurs ne sont pas symétriques autour de 39, ce qui distingue le khi-deux de la normale et de Student.
La loi de Student tν, quotient Z/C/ν d'une normale par la racine d'un khi-deux réduit indépendant. Elle est symétrique, en cloche, mais à queues plus épaisses que la normale: sa variance ν/(ν−2) excède 1. Sa densité est
fν(t)=νπΓ(2ν)Γ(2ν+1)(1+νt2)−2ν+1,t∈R,
et elle tend vers la densité φ de N(0,1) quand ν→∞. Elle sert dès que l'on remplace un σ inconnu par Sn: intervalles de confiance et tests sur une moyenne (chapitres 11 et 12).
La loi de Fisher Fν1,ν2, quotient de deux khi-deux réduits indépendants:
Elle vit sur [0,+∞[, elle est asymétrique à droite, et elle vérifie la relation utile Fν1,ν2;α=1/Fν2,ν1;1−α, qui permet de ne tabuler que les quantiles supérieurs. Elle sert à comparer deux variances — donc à décider, au chapitre 12, si les deux machines de l'atelier dispersent de la même façon — et elle est l'outil de base de l'analyse de la variance. Deux liens à retenir: F1,ν=tν2, et ν1Fν1,ν2→χν12 quand ν2→∞.
Les quantiles de ces trois lois ne s'expriment pas par des fonctions élémentaires: ils se lisent dans une table ou se calculent numériquement. L'annexe A donne les tables de Φ, de tν, de χν2 et de Fν1,ν2, chacune accompagnée d'un exemple de lecture; toutes y ont été produites par intégration numérique, et les valeurs citées dans ce chapitre en proviennent.
Question 9.7
Le diamètre d'une pièce suit N(20,00;0,0552). On prélève un échantillon aléatoire simple de n=30 pièces. Calculez l'écart-type de la moyenne empirique Xˉ30, en millimètres.
Synthèse
La probabilité va du modèle aux données, la statistique des données au modèle. Le chapitre 9 décrit les données (première moitié), puis pose le modèle probabiliste qui rend l'inférence possible (seconde moitié); les chapitres 10, 11 et 12 estiment, encadrent et testent.
Le type du caractère décide de tout: pas de moyenne sur un ordinal, pas de médiane sur un nominal, pas de tableau valeur par valeur sur un continu. Dans un histogramme, c'est l'aire des rectangles qui porte la fréquence — la hauteur est fi/hi —, et cette règle n'est visible que lorsque les classes sont inégales, c'est-à-dire précisément quand on l'oublie.
La moyenne utilise toute l'information numérique mais cède devant une seule valeur aberrante; la médiane et l'écart interquartile résistent. On publie les deux et l'on commente leur écart: xˉ<Me signale une queue à gauche, comme sur l'échantillon A où xˉA=20,003 et Me=20,01.
La variance d'un échantillon se calcule avec le diviseur n−1: sA2=0,0030102 mm², sA=0,054865 mm. La raison est le théorème 9.3, E[Sn2]=σ2, dont la démonstration montre qu'un degré de liberté a été dépensé pour estimer par .
Le modèle de l'échantillon aléatoire simple — X1,…,Xn i.i.d. — sépare définitivement l'estimateurXˉn, variable aléatoire dont on calcule la loi, de l'estimationxˉn=20,00275, nombre observé. La majuscule n'est pas décorative: toutes les probabilités du cours portent sur des majuscules.
Les lois d'échantillonnage: E[Xˉn]=μ et Var(Xˉn)=σ2/n toujours; exactement si la population est normale, approximativement sinon par le TCL du chapitre 8; toujours; et, dans le cas normal, indépendante de , d'où . Ces cinq résultats sont l'outillage complet des chapitres 10 à 12.
Série d'exercices du chapitre 9Exercice 1 sur 5
Question 9.8
Un histogramme est tracé sur des classes de largeurs 5, 5 et 20 unités, d'effectifs respectifs 25, 40 et 35, sur 100 observations. Quelle est la hauteur du troisième rectangle en densité de fréquence?
Problème guidé 9.1 · Analyse descriptive de la machine B
La machine B de l'atelier Jura Précision a été contrôlée sur n=30 pièces (données fictives, en mm), rangées par ordre croissant: 19,92 · 19,93 · 19,96 · 19,97 · 19,99 · 19,99 · 20,01 · 20,01 · 20,01 · 20,01 · 20,01 · 20,02 · 20,02 · 20,02 · 20,02 · 20,02 · 20,03 · 20,03 · 20,04 · 20,05 · 20,05 · 20,06 · 20,07 · 20,09 · 20,09 · 20,10 · 20,12 · 20,12 · 20,12 · 20,13. On sait que ∑xi=601,01 et ∑(xi−xˉ)2=0,0856967. La tolérance reste [19,90;20,10].
1
Position
Commencez par les deux indicateurs de position que l'on publie toujours ensemble.
Question
Calculez la moyenne xˉB, en mm, à cinq décimales.
Dispersion
Boîte à moustaches et rebuts
Loi d'échantillonnage
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Exercice 9.1 · Une série complète de A à Z
Douze interventions de maintenance ont duré, en minutes: 4, 5, 5, 6, 7, 7, 7, 8, 9, 10, 12, 18.
Donner le type du caractère, puis calculer la moyenne, la médiane et le mode.
Calculer Q1, Q3, l'étendue et l'écart interquartile avec la convention (9.4).
Calculer la variance s2 et l'écart-type s (diviseur n−1), à l'aide de .
Solution
1. La durée est un caractère quantitatif continu, arrondi ici à la minute. La série est déjà rangée, n=12.
xˉ=124+5+5+6+7+7+7+8+9+10+12+18=1298=8,1667 min.
Exercice 9.2 · Classes inégales, tableau et histogramme
Une enquête porte sur 100 interventions, dont les durées (en minutes) sont publiées ainsi:
Classe
[0;10[
[10;20[
[20;40[
[40;80[
Effectif
12
30
36
22
Compléter le tableau par les fréquences, les fréquences cumulées et les hauteurs correctes de l'histogramme.
Quelle classe paraîtrait la plus importante si l'on portait les effectifs en ordonnée? Laquelle l'est réellement en densité?
Estimer la médiane par interpolation linéaire dans la classe médiane, ainsi que Q1 et Q3.
Calculer la moyenne et l'écart-type de la série groupée, en utilisant les centres de classes.
Solution
1. Avec n=100, fi=ni/100 et la hauteur di=fi/hi:
Exercice 9.3 · Changements d'unité et standardisation
Soit une série x1,…,xn de moyenne xˉ et d'écart-type s>0.
Montrer que si yi=axi+b avec a,b∈R, alors yˉ=axˉ+b et .
Solution
1. Pour la moyenne, par linéarité de la somme:
yˉ=n1i∑(axi+b)=nai∑xi+nnb=axˉ+b.
Exercice 9.4 · Moyenne et variance d'un échantillon: le calcul complet
Soit X1,…,Xn un échantillon aléatoire simple issu d'une population d'espérance μ et de variance σ2 finies.
Démontrer que E[Xˉn]=μ et Var(Xˉn)=σ2/n en précisant à quel endroit l'indépendance est utilisée.
Solution
1. Par linéarité de l'espérance, valable sans aucune hypothèse sur la dépendance,
E[Xˉn]=n1i=1∑nE[Xi]=nnμ=μ.
Exercice 9.5 · Lois d'échantillonnage et lois dérivées
Le diamètre produit par la machine A est modélisé par N(μ,σ2) avec σ=0,055 mm. On prélève un échantillon aléatoire simple de n=40 pièces.
Donner la loi exacte de Xˉ40 et calculer P(∣Xˉ40−μ∣≤0,015).
Donner la loi exacte de 39S402/σ2, son espérance et sa variance. En déduire E[S402] et Var(S402), puis l'écart-type de .
Sachant que χ39;0,0252=23,654 et χ39;0,9752=58,120, déterminer un intervalle tel que . La valeur observée mm² y est-elle?
Pourquoi ne peut-on pas remplacer σ par sA dans la question 1 sans changer de loi? Quelle loi faut-il alors, et de combien le quantile à 97,5% augmente-t-il?
Solution
1. Par le théorème 9.2, point 1, la loi est exacte sans condition sur n:
Xˉ40∼N(μ,400,0552),40σ=6,324560,055=0,0086963 mm.
Références
Morgenthaler, S., Introduction à la statistique, 3e éd., Presses polytechniques et universitaires romandes, Lausanne — chapitres sur la statistique descriptive et l'échantillonnage.
Dodge, Y., Statistique — dictionnaire encyclopédique, Springer, Paris — entrées «boîte à moustaches», «quantile», «coefficient d'asymétrie».
Saporta, G., Probabilités, analyse des données et statistique, 3e éd., Technip, Paris — chapitres 1 et 2 pour la description, chapitre 10 pour les lois d'échantillonnage.
Rice, J. A., Mathematical Statistics and Data Analysis, 3e éd., Duxbury, Belmont — chapitre 6, «Distributions derived from the normal distribution».
Wackerly, D., Mendenhall, W. et Scheaffer, R., Mathematical Statistics with Applications, 7e éd., Cengage, Boston — chapitre 7, «Sampling distributions and the central limit theorem».
Tukey, J. W., Exploratory Data Analysis, Addison-Wesley, Reading — l'ouvrage qui a introduit la boîte à moustaches et la règle des 1,5 écarts interquartiles.
x↦F(x)=n1#{j∣xj≤x}
fonction de répartition empirique
FX
20,075
8
0,200
40
1,000
Total
40
1,000
40%
[20,00;20,05[
Hauteur fautive fi
[19,85;19,95[
0,10
5
0,125
1,25
0,125
[19,95;20,00[
0,05
11
0,275
5,50
0,275
[20,00;20,05[
0,05
16
0,400
8,00
0,400
[20,05;20,10[
0,05
8
0,200
4,00
0,200
moyenne pondérée
−2∑i(xi−t)=0
t=xˉ
valeurs absolues
Q3=q0,75
déciles
qk/10
centiles
qk/100
mode
−1000
robuste
point de rupture
50%
vn
nn−1σ2
σ2
1/n
2,5%
n=40
20%
n=5
0,054175
1,3%
40
77,5%
xˉA±2sA=[19,893;20,112]
37
92,5%
68,3%
95,4%
plus concentrée
moins
40
68
95
np=15
p=0,5
Me=(x(15)+x(16))/2=20,02
np=22,5
p=0,75
Q3=x(23)=20,07
EIQ=0,06
19,92
20,16
19,92
pas
20,13
20,16
aucun point atypique
Xˉ40
Sn2
sn2=0,0030102
p^
0,075
erreur type
n=116
0,010009>0,01
40
117
117/40=1,71
7,5%
σ/40
μ
Xˉn
Xˉn∼N(μ,σ2/n)
E[Sn2]=σ2
(n−1)Sn2/σ2∼χn−12
Xˉn
(Xˉn−μ)/(Sn/n)∼tn−1
∑xi2=962
Construire la boîte à moustaches: barrières, moustaches, points atypiques éventuels.
La valeur 18 est-elle une erreur? Recalculer moyenne, médiane et écart-type sans elle et commenter.
Médiane: np=6 est entier, donc Me=(x(6)+x(7))/2=(7+7)/2=7,0 min. Mode: la valeur 7 apparaît trois fois, plus que toute autre, donc le mode est 7 min. On a xˉ>Me: queue à droite.
2.np=3 pour p=0,25: Q1=(x(3)+x(4))/2=(5+6)/2=5,5 min. np=9 pour p=0,75: Q3=(x(9)+x(10))/2=(9+10)/2=9,5 min. Étendue e=18−4=14 min; EIQ=9,5−5,5=4,0 min. Le contraste entre les deux est déjà éloquent: la moitié centrale tient dans 4 minutes, l'ensemble dans 14.
3. Par König–Huygens, ∑(xi−xˉ)2=962−12×8,16672=962−800,3333=161,6667, puis
s2=11161,6667=14,697 min2,s=3,8337 min.
Le coefficient de variation vaut 3,8337/8,1667=0,469, soit 46,9%: ici il a un sens, car une durée a un zéro absolu, et il dit que la dispersion est de l'ordre de la moitié de la durée typique — c'est beaucoup, et c'est banal pour des durées d'intervention.
4. Barrières: Q1−1,5EIQ=5,5−6=−0,5 et Q3+1,5EIQ=9,5+6=15,5. Toutes les observations sont supérieures à −0,5, donc la moustache inférieure descend jusqu'au minimum 4. Une observation dépasse 15,5: la valeur 18, qui est portée en point atypique; la moustache supérieure s'arrête à la plus grande valeur restante, 12. La boîte va de 5,5 à 9,5, avec le trait médian à 7 — donc décalé vers la gauche de la boîte, et la moustache droite (9,5 à 12, soit 2,5) est plus longue que la gauche (4 à 5,5, soit 1,5). Les trois indices concordent: asymétrie à droite.
5. Rien ne permet de dire que 18 est une erreur. La boîte signale une observation qui mérite un examen, pas une observation à supprimer: une intervention longue est un événement parfaitement plausible, et c'est peut-être justement celle qui intéresse le service. Sans elle, n=11 et
xˉ′=1180=7,2727 min,Me′=7 min,s′=2,3703 min.
La moyenne perd 0,89 minute, soit 11%; l'écart-type est presque divisé par 1,6; la médiane ne bouge pas. Une seule observation sur douze pesait donc près de 40% de l'écart-type: c'est exactement ce que l'exemple 9.2 annonçait, et c'est la raison de publier la médiane à côté de la moyenne. La conduite correcte est de rapporter les deux analyses en disant ce qu'on a retiré et pourquoi, jamais de faire disparaître silencieusement une valeur gênante.
2. À l'effectif, la classe [20;40[ paraîtrait la plus importante (36), suivie de [10;20[ (30) et de [40;80[ (22). En densité, l'ordre change complètement: la classe la plus dense est [10;20[ (0,0300), puis [20;40[ (0,0180), puis [0;10[ (0,0120), et enfin [40;80[ (0,0055), qui est cinq fois moins dense que la première alors qu'elle rassemble presque deux fois plus d'observations. L'histogramme à l'effectif ferait de la dernière classe un bloc imposant; l'histogramme correct en fait une longue traîne basse, ce qui est la réalité: 22 interventions réparties sur 40 minutes.
3. La fréquence cumulée atteint 0,42 à 20 min et 0,78 à 40 min: la médiane est dans [20;40[. En supposant les observations uniformément réparties dans la classe,
Me≈20+3650−42×20=20+4,44=24,4 min.
De même, F atteint 0,12 à 10 et 0,42 à 20: Q1 est dans [10;20[, et Q1≈10+3025−12×10=14,3 min. Enfin Q3 est dans [20;40[: Q3≈20+3675−42×20=38,3 min. L'écart interquartile estimé vaut 24,0 min. Ces valeurs sont des estimations liées à l'hypothèse d'uniformité dans les classes; avec les données brutes on n'interpolerait pas.
4. Centres de classes: 5, 15, 30, 60.
xˉ=10012(5)+30(15)+36(30)+22(60)=10060+450+1080+1320=29,1 min.
d'où s2=33969,00/99=343,12 min² et s=18,52 min. Remarquez que xˉ=29,1 dépasse nettement la médiane estimée 24,4: la série est étalée vers le haut, ce que confirme la longue classe finale. Comme toujours pour une série groupée, ces deux nombres sont approchés — le centre de classe remplace des valeurs qu'on ne connaît plus.
sy=∣a∣s
Qu'advient-il de la médiane et de l'écart interquartile sous la même transformation, selon le signe de a?
On pose zi=(xi−xˉ)/s. Calculer zˉ et sz. Comment s'appelle cette opération et à quoi sert-elle?
Application: les 40 diamètres de l'atelier sont réexprimés en écarts au nominal, en micromètres, par yi=(xi−20,00)×1000. Donner yˉ, Mey et sy.
Pour la variance, l'écart à la moyenne devient yi−yˉ=axi+b−(axˉ+b)=a(xi−xˉ) — la translation b disparaît. Donc
sy2=n−11i∑a2(xi−xˉ)2=a2s2,sy=a2s2=∣a∣s.
La valeur absolue est indispensable: un écart-type est positif par définition, même si a<0.
2. La médiane et les quantiles ne dépendent que de l'ordre. Si a>0, la transformation est croissante, l'ordre est préservé et Mey=aMex+b, Q1,y=aQ1,x+b, Q3,y=aQ3,x+b, donc EIQy=aEIQx. Si a<0, la transformation renverse l'ordre: la médiane suit toujours la formule (Mey=aMex+b, car la position centrale reste centrale), mais les quartiles échangent leurs rôles: Q1,y=aQ3,x+b et Q3,y=aQ1,x+b, de sorte que EIQy=∣a∣EIQx, à nouveau positif. C'est une erreur classique de calculer aQ1+b et d'obtenir un «troisième quartile» inférieur au premier.
3. C'est le cas a=1/s, b=−xˉ/s. Donc
zˉ=sxˉ−sxˉ=0,sz=s1s=1.
Cette opération est la standardisation (ou centrage-réduction); les zi sont les scores standardisés. Elle rend comparables des séries d'unités différentes — un zi=2,3 signifie «cette observation est à 2,3 écarts-types au-dessus de la moyenne de sa propre série», que la série soit en millimètres ou en francs. C'est exactement la transformation X→Z=(X−μ)/σ du chapitre 6, appliquée ici à des données au lieu d'une variable aléatoire, avec xˉ et s à la place de μ et σ. Attention: standardiser ne rend pas une série normale; cela ne fait que déplacer et dilater son histogramme, dont la forme est inchangée.
Sous cette forme, les nombres parlent enfin: la machine est décalée de 2,75 µm au-dessus du nominal, ce qui est négligeable, et elle disperse à ±55 µm, ce qui ne l'est pas du tout puisque la tolérance n'autorise que ±100 µm. C'est la dispersion, et non le centrage, qu'il faut attaquer. Notez aussi que sy/yˉ=19,95: le coefficient de variation, ici, est une absurdité — preuve qu'il ne s'emploie que lorsque le zéro de l'échelle a un sens.
En déduire E[∑i(Xi−Xˉn)2], puis E[Sn2].
Que vaudrait E[Vn] pour Vn=n1∑i(Xi−Xˉn)2? De combien de pour cent Vn sous-estime-t-elle σ2 en moyenne pour n=5, n=40 et n=1000?
Cas de Bernoulli: si les Xi valent 1 avec probabilité p et 0 sinon, montrer que Xˉn=p^ est la proportion observée, calculer E[p^] et Var(p^), et montrer que Sn2=n−1np^(1−p^).
Pour la variance, Var(aY)=a2Var(Y) donne Var(Xˉn)=n21Var(∑iXi). C'est ici et seulement ici qu'intervient l'hypothèse: en général Var(∑iXi)=∑iVar(Xi)+2∑i<jCov(Xi,Xj), et les covariances s'annulent parce que les Xi sont indépendantes — la non-corrélation suffirait d'ailleurs. Il reste n21nσ2=σ2/n.
2. L'identité ∑i(Xi−Xˉn)2=∑i(Xi−μ)2−n(Xˉn−μ)2 (démonstration du théorème 9.3) donne, en espérance,
E[i∑(Xi−Xˉn)2]=nσ2−nVar(Xˉn)=nσ2−σ2=(n−1)σ2,
d'où E[Sn2]=σ2.
3.Vn=nn−1Sn2, donc E[Vn]=nn−1σ2: Vn sous-estime σ2 de σ2/n, soit une sous-estimation relative de 1/n. Numériquement: 20% pour n=5, 2,5% pour n=40, 0,1% pour n=1000. La correction n'a donc d'importance pratique que sur les petits échantillons — mais c'est précisément là qu'on a besoin qu'elle soit juste. Sur l'échantillon A, v40=0,0029349 contre sA2=0,0030102 mm²: le rapport est bien 39/40=0,975.
4. Chaque Xi vaut 0 ou 1, donc ∑iXi est le nombre de succès et Xˉn=n1∑iXi est la proportion de succès, notée p^. Comme E[Xi]=p et Var(Xi)=p(1−p) (chapitre 4), le point 1 donne directement
E[p^]=p,Var(p^)=np(1−p).
Pour Sn2, remarquons que Xi2=Xi puisque Xi∈{0,1}, donc ∑iXi2=∑iXi=np^. Par (9.6),
et en divisant par n−1, Sn2=n−1np^(1−p^). Application à l'atelier: la proportion de pièces hors tolérance vaut p^=3/40=0,075, donc s2=3940(0,075)(0,925)=0,071154 et s=0,26675. L'erreur type de p^, si l'on prend p≈0,075, vaut 0,075×0,925/40=0,04165, soit plus de quatre points de pourcentage: quarante pièces ne permettent pas d'estimer un taux de rebut avec précision, et c'est un résultat qu'il vaut mieux connaître avant de commander le prélèvement. Le chapitre 11 en fera un intervalle de confiance.
L'écart-type de S402 vaut 4,6926⋅10−7=6,850⋅10−4 mm², soit 22,6% de σ2 lui-même. La variance empirique est un estimateur très dispersé: sans biais ne veut pas dire précis, et c'est une des raisons pour lesquelles le chapitre 11 construira des intervalles nettement plus larges pour une variance que pour une moyenne.
3. De P(23,654≤C≤58,120)=0,95 et C=39S402/σ2, on tire
P(3923,654σ2≤S402≤3958,120σ2)=0,95.
Avec σ2=0,003025 mm²: c1=23,654×0,003025/39=0,0018347 mm² et c2=58,120×0,003025/39=0,0045080 mm². La valeur observée sA2=0,0030102 mm² est bien dans [0,0018347;0,0045080], et même très près du centre: rien, dans cet échantillon, ne contredit l'hypothèse σ=0,055 mm. Notez la largeur de l'intervalle — un facteur 2,46 entre ses deux bornes — et son asymétrie autour de σ2: la borne haute est à +49% de σ2, la borne basse à −39%. Un intervalle de khi-deux n'est jamais symétrique.
4. Parce que sA n'est pas σ: c'est la réalisation d'une variable aléatoire S40 qui, d'après la question 2, fluctue de plus de 10% d'un échantillon à l'autre (l'écart-type de S40 vaut environ σ/2(n−1)=0,055/78=0,00623 mm, soit 11,3% de σ). En divisant par une quantité aléatoire, on ajoute de l'incertitude et la loi du rapport cesse d'être normale: par le théorème 9.5, (Xˉ40−μ)/(S40/40) suit une loi de Student à 39 degrés de liberté.
Le quantile passe de z0,975=1,9600 à t39;0,975=2,0227, soit une augmentation de 3,20%. Sur un intervalle de confiance, cela transforme la demi-largeur 1,9600×0,0086963=0,017044 mm (si σ était connu) en 2,0227×0,054865/40=0,017547 mm: un demi-micromètre de plus. C'est le prix, modeste pour n=40, de notre ignorance de σ — mais pour n=5 le quantile serait t4;0,975=2,776 au lieu de 1,960, soit 42% de plus.