Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
- distinguer la démarche probabiliste, qui va du modèle aux données, de la démarche statistique, qui va des données au modèle, et situer les chapitres 9 à 13 dans cette seconde démarche;
- reconnaître le type d'un caractère (qualitatif nominal ou ordinal, quantitatif discret ou continu) et en déduire le tableau, le graphique et les résumés licites;
- construire un tableau d'effectifs et de fréquences, choisir une largeur de classe et tracer un histogramme correct, y compris lorsque les classes sont inégales;
- calculer et interpréter les indicateurs de position (moyenne, médiane, mode, quantiles) et de dispersion (étendue, écart interquartile, variance, écart-type, coefficient de variation), et discuter leur sensibilité aux valeurs extrêmes;
- construire et lire une boîte à moustaches selon la règle des écarts interquartiles, et décrire l'asymétrie d'une distribution;
- tracer et lire le nuage de points d'une série double, calculer la covariance et le coefficient de corrélation empiriques, et dire ce que ce coefficient ne mesure pas — lien non linéaire, points aberrants, causalité;
- formuler le modèle de l'échantillon aléatoire simple, distinguer l'estimateur de l'estimation , et énoncer les lois d'échantillonnage de et de qui serviront aux chapitres 10 à 13.
Du modèle aux données: le sens de la marche s'inverse
Deux démarches symétriques
Les huit premiers chapitres ont construit un outillage probabiliste. À chaque fois, le point de départ était un modèle — une urne, un dé équilibré, une loi , une loi dont les paramètres étaient donnés — et la question était: que vont produire les données? Le chapitre 4 calculait pour une binomiale connue; le chapitre 6 calculait pour une normale de paramètres connus; le chapitre 8 décrivait le comportement de la moyenne de tirages d'une loi connue.
La statistique inverse la flèche. On dispose maintenant de données — quarante diamètres mesurés, mille réponses à un sondage, trente durées de vie — et le modèle est inconnu. On veut, à partir de ces données:
- les résumer honnêtement, c'est-à-dire les remplacer par quelques nombres et quelques images sans les trahir: c'est la statistique descriptive, l'objet de la première moitié de ce chapitre;
- estimer les paramètres du modèle qui les a produites: c'est l'estimation ponctuelle, chapitre 10;
- quantifier l'incertitude de cette estimation: c'est l'intervalle de confiance, chapitre 11;
- trancher entre deux hypothèses concurrentes en contrôlant le risque de se tromper: c'est le test d'hypothèses, chapitre 12.
- relier deux variables, ou comparer plusieurs groupes à la fois: c'est la régression et l'analyse de la variance, chapitre 13.
La statistique descriptive et la statistique inférentielle ne diffèrent donc pas par les calculs — on calcule la même moyenne — mais par la portée de ce qu'on en dit. Dire «la moyenne des quarante pièces mesurées est mm» est une description: c'est vrai, exactement, et sans hypothèse. Dire «le diamètre moyen produit par cette machine vaut mm» est une inférence: c'est une affirmation sur une population qu'on n'a pas observée, et elle ne peut être ni certaine ni dépourvue d'hypothèses. Toute la seconde moitié du cours consiste à rendre ce deuxième énoncé défendable, en lui accolant une marge et un risque.
Le fil rouge: l'atelier d'usinage «Jura Précision»
Un même jeu de données parcourra les chapitres 9 à 13. Un atelier d'usinage jurassien produit des axes de diamètre nominal mm; le bureau des méthodes a fixé l'intervalle de tolérance mm, en dehors duquel la pièce est rebutée. Pour contrôler la machine A, on prélève pièces et on mesure leur diamètre au micromètre, au centième de millimètre.
Voici les mesures, en millimètres, rangées par ordre croissant:
| 19,85 | 19,87 | 19,88 | 19,93 | 19,94 | 19,96 | 19,96 | 19,96 | 19,96 | 19,97 |
| 19,98 | 19,98 | 19,98 | 19,99 | 19,99 | 19,99 | 20,01 | 20,01 | 20,01 | 20,01 |
| 20,01 | 20,02 | 20,02 | 20,03 | 20,03 | 20,03 | 20,04 | 20,04 | 20,04 | 20,04 |
| 20,04 | 20,04 | 20,05 | 20,05 | 20,05 | 20,05 | 20,06 | 20,07 | 20,08 | 20,09 |
Quarante nombres ne se lisent pas. Même rangés, ils ne répondent à aucune des questions que se pose le chef d'atelier: la machine est-elle centrée sur ? disperse-t-elle trop? combien de rebuts faut-il prévoir? Le travail du chapitre est de transformer ce tableau en trois ou quatre nombres et deux images qui, elles, répondent.
Population, échantillon, individu, caractère
Le vocabulaire
Dans l'atelier, la population est l'ensemble des axes que la machine A produit dans les conditions de réglage du jour — un ensemble qu'on peut considérer comme indéfiniment grand, puisque la machine pourrait continuer à tourner; l'individu est une pièce; l'échantillon est constitué des pièces prélevées; le caractère est le diamètre, exprimé en millimètres.
Deux remarques valent d'être faites tout de suite. D'abord, la population est définie par l'étude, pas par la nature: si le réglage change à midi, la population du matin et celle de l'après-midi sont deux populations distinctes, et mélanger les deux échantillons produirait une image trompeuse. Ensuite, une population n'a pas besoin d'exister physiquement en entier: la «population des axes produits par cette machine à ce réglage» est en partie virtuelle, et c'est le cas le plus fréquent en contrôle industriel comme en sciences expérimentales.
Les types de caractères
La distinction qui gouverne tout le reste est celle-ci: le type du caractère décide du tableau, du graphique et du résumé qui ont un sens. Appliquer une moyenne à un caractère qui n'en supporte pas est la faute la plus commune, et elle produit des nombres qui ont l'air de vouloir dire quelque chose.
Ce que chaque type autorise:
| Type | Tableau | Graphique | Position | Dispersion |
|---|---|---|---|---|
| Qualitatif nominal | effectifs et fréquences par modalité | diagramme en barres, camembert | mode | aucune (indice de diversité) |
| Qualitatif ordinal | effectifs, fréquences, cumuls | barres ordonnées | mode, médiane, quantiles | écart interquartile (en rangs) |
| Quantitatif discret | effectifs par valeur | diagramme en bâtons | mode, médiane, moyenne | étendue, écart-type |
| Quantitatif continu | effectifs par classe | histogramme, polygone des fréquences cumulées | médiane, moyenne, quantiles | étendue, EIQ, écart-type |
Trois conséquences pratiques. Un caractère nominal n'a pas de médiane: la médiane suppose de ranger les individus, et on ne range pas des cantons. Un caractère ordinal a une médiane mais pas de moyenne: la moyenne d'un satisfaction codée à n'a de sens que si l'on postule que passer de à «vaut» autant que passer de à — postulat rarement défendable, et jamais vérifié par le codage lui-même. Enfin, un caractère continu ne se tabule pas valeur par valeur: les diamètres ne prennent que valeurs distinctes ici seulement parce que le micromètre arrondit au centième; avec un appareil plus fin, toutes les valeurs seraient distinctes et le tableau des effectifs ne dirait plus rien. D'où les classes.
Une enquête relève, pour chaque employé: le service (production, vente, administration), l'ancienneté en années, le niveau de satisfaction (insatisfait, neutre, satisfait) et le nombre de jours d'absence de l'année. Quel est le seul de ces quatre caractères pour lequel la moyenne arithmétique n'a manifestement aucun sens, alors que la médiane en a un?
Tableaux d'effectifs, classes et histogramme
Effectifs, fréquences et cumuls
La somme des fréquences vaut : c'est la première vérification à faire sur tout tableau, et elle attrape la plupart des erreurs de comptage. Nous l'écrirons systématiquement.
Le choix des classes
Pour un caractère continu, on partitionne l'étendue des valeurs en classes — traditionnellement fermées à gauche et ouvertes à droite, de sorte qu'aucune valeur ne tombe dans deux classes. Le choix de la largeur et de l'origine n'est dicté par aucune loi; deux repères usuels aident à le faire:
- la règle de Sturges: classes, soit pour ;
- la règle de la racine: , soit également ici.
L'étendue des diamètres vaut mm; une largeur mm donne classes. Nous la retenons pour une raison qui n'est pas arithmétique mais métier: elle fait coïncider les bords de classes avec les deux limites de tolérance et mm. Un découpage qui aligne les classes sur les seuils de décision se lit sans calcul.
L'histogramme, et le piège des classes inégales
Lorsque toutes les classes ont la même largeur, est constant et la hauteur est proportionnelle à : on peut alors porter directement les effectifs en ordonnée, et c'est ce que fait la figure 9.1. Mais dès que les largeurs diffèrent, porter l'effectif en hauteur falsifie la figure.
La forme se lit d'un coup d'œil: un mode franc juste au-dessus du nominal, une chute rapide à droite, une queue plus longue à gauche. C'est cette dissymétrie qui explique que la moyenne soit inférieure à la médiane, et c'est elle qui produit les trois rebuts. Une machine parfaitement centrée et symétrique avec le même écart-type produirait des rebuts des deux côtés, en nombre à peu près égal.
La largeur de classe change l'image, pas les données
Les 40 diamètres de l'échantillon A (données fictives) regroupés en classes de largeur h à partir d'une origine que vous choisissez. L'histogramme se reconstruit à chaque mouvement; la moyenne, la médiane et l'écart-type, eux, sont calculés sur les données brutes et ne bougent pas.
Faites varier la largeur de à mm et déplacez l'origine du découpage. L'histogramme passe d'un peigne illisible, où chaque valeur du micromètre forme sa propre barre, à trois gros blocs qui écrasent toute la structure; entre les deux, autour de à mm, la forme réelle apparaît. Déplacer seulement l'origine, à largeur fixée, suffit parfois à faire naître ou disparaître un second sommet: un mode secondaire visible pour un seul découpage n'est pas un résultat.
Pendant ce temps, les trois derniers cadrans ne bougent pas d'un chiffre: la moyenne reste , la médiane , l'écart-type . C'est la leçon de l'explorateur, et elle vaut d'être formulée: l'histogramme est une représentation, avec sa part d'arbitraire; les indicateurs numériques sont des fonctions des données, et ils ne dépendent d'aucun choix de l'analyste. Quand une figure et un nombre se contredisent, c'est la figure qu'il faut refaire.
Une enquête de l'atelier regroupe 200 durées d'intervention en trois classes: min avec 40 interventions, min avec 90, et min avec 70. Quelle hauteur faut-il donner au rectangle de la dernière classe dans un histogramme des fréquences, c'est-à-dire quelle est sa densité de fréquence par minute?
Indicateurs de position
Moyenne arithmétique
Trois propriétés à retenir, toutes de vérification immédiate:
- La somme des écarts à la moyenne est nulle: . La moyenne est le point d'équilibre de la série — son centre de gravité, exactement comme l'espérance au chapitre 3.
Pour l'échantillon A, la somme des diamètres vaut mm, d'où
que l'on arrondira à mm pour l'énoncer. Nous conservons la valeur non arrondie dans tous les calculs intermédiaires et n'arrondissons qu'au moment d'écrire un résultat: arrondir en cours de route sur une variance se paie très cher.
Médiane, mode, quantiles
La définition (9.4) est celle que ce cours utilisera partout. Elle se lit ainsi: le quantile d'ordre est une valeur qui coupe la série en laissant au moins la proportion des observations à sa gauche et au moins à sa droite; quand plusieurs valeurs conviennent, on prend le milieu de l'intervalle. La médiane est donc la valeur centrale pour impair, et la demi-somme des deux valeurs centrales pour pair.
Pour l'échantillon A, :
- pour : mm;
Le mode se lit sur la série brute: la valeur apparaît six fois, plus que toute autre. Sur la série groupée, la classe modale est .
Résistance: la moyenne cède, la médiane tient
Voici la raison pour laquelle on donne presque toujours les deux.
Remettez dans l'ordre les étapes du calcul de la médiane d'une série de valeurs numériques.
Glissez les éléments pour les mettre dans le bon ordre
- Calculer le produit
- Comparer la médiane obtenue à la moyenne pour diagnostiquer l'asymétrie
- Ranger les valeurs par ordre croissant
- Si ce produit est entier, prendre la demi-somme des valeurs de rangs et ; sinon prendre la valeur de rang
- Vérifier que le caractère est au moins ordinal
Indicateurs de dispersion
Deux séries peuvent avoir la même moyenne et n'avoir rien à voir. Un axe usiné à mm et un axe usiné à mm ont la même position et des destins opposés: le second remplit la benne à rebuts. La dispersion n'est pas un complément de la position, c'est la moitié de l'information.
Étendue et écart interquartile
Pour l'échantillon A: mm et mm. L'étendue est le plus simple des indicateurs et le plus fragile: elle ne dépend que des deux valeurs extrêmes, donc elle est déterminée par les deux observations les moins fiables, et elle croît mécaniquement avec (plus on mesure de pièces, plus on a de chances d'en rencontrer une extrême). L'écart interquartile est au contraire robuste, pour la même raison que la médiane, et c'est lui qui donne sa largeur à la boîte du paragraphe suivant.
Variance et écart-type
Le calcul direct de (9.5) demande deux passages sur les données. La formule suivante, dite de König–Huygens (c'est l'analogue empirique de du chapitre 3), n'en demande qu'un:
Démonstration. En développant le carré, , et , d'où .
On mesure les mêmes 40 pièces, mais on décide d'exprimer l'écart au nominal en micromètres: . Que deviennent la moyenne et l'écart-type?
Boîte à moustaches et forme de la distribution
La construction, énoncée précisément
Deux erreurs sont fréquentes et se voient tout de suite sur une figure: faire aller les moustaches jusqu'aux barrières (elles s'arrêtent à des valeurs observées, et sont donc de longueurs inégales), et faire aller les moustaches jusqu'au minimum et au maximum sans marquer les points atypiques (on perd alors précisément l'information que la boîte est faite pour donner).
Le coefficient n'a rien de sacré. Il vient de Tukey, qui l'a choisi parce que pour une population normale environ des observations tombent au-delà des barrières: sur pièces normales, on s'attend à point atypique, donc en général aucun. Un point signalé par la boîte n'est donc pas une erreur de mesure: c'est une observation dont la position mérite qu'on aille voir. Le supprimer sans raison est une faute; ne pas le regarder en est une autre.
Asymétrie et forme
La boîte donne trois indices de forme, lisibles sans calcul: la position du trait médian dans la boîte, la longueur relative des deux moustaches, et le côté où se trouvent les points atypiques. Une distribution symétrique a la médiane au milieu de la boîte et deux moustaches de même longueur. Une distribution étalée à droite (asymétrie positive) a la médiane décalée vers la gauche de la boîte et une moustache droite plus longue: c'est la forme de presque toutes les durées, de tous les revenus, de toutes les tailles de fichiers. Une distribution étalée à gauche a le profil inverse.
On peut chiffrer cette impression. Le coefficient d'asymétrie (skewness) d'une série est le moment centré d'ordre trois réduit:
Le cube conserve le signe des écarts: une queue à droite fournit de grands écarts positifs au cube, donc ; une queue à gauche donne ; une distribution symétrique donne . Sur nos deux échantillons: et . L'échantillon A est nettement étalé vers la gauche — un écart-type d'asymétrie, entièrement produit par les trois pièces trop petites —, l'échantillon B est pratiquement symétrique.
Un dernier mot sur le vocabulaire des formes. On dit une distribution unimodale si elle a un seul sommet, bimodale si elle en a deux — et une distribution bimodale nette signale presque toujours un mélange de deux populations qu'il fallait séparer (deux machines, deux équipes, deux lots de matière). On parle enfin d'aplatissement (kurtosis) pour l'épaisseur des queues, un quatrième moment que nous n'utiliserons pas dans ce cours.
Douze interventions de maintenance ont duré, en minutes: 4, 5, 5, 6, 7, 7, 7, 8, 9, 10, 12, 18. Calculez l'écart interquartile avec la convention (9.4) du cours.
Deux caractères à la fois: nuage de points et corrélation
Jusqu'ici, chaque pièce portait un nombre. Très souvent on en mesure deux sur le même individu, et la question intéressante est alors leur relation: le diamètre dépend-il de la température de l'atelier? de l'usure de l'outil? Une série de couples s'appelle une , et ses outils de description sont un graphique et deux nombres.
Le nuage de points
Le chapitre 9 a déjà évoqué la crainte du chef d'atelier: si l'outil s'use, le diamètre dérive de pièce en pièce. Pour la vérifier, l'atelier conduit l'essai suivant (données fictives). Juste après l'affûtage de l'outil de la machine A, on prélève une pièce à la fin de chaque heure de production, pendant dix heures, et on la mesure sur la machine à mesurer tridimensionnelle du laboratoire, au micromètre près. On note la durée d'usinage depuis l'affûtage, en heures, et l'écart du diamètre au nominal, en micromètres: .
| Durée (h) | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 |
|---|---|---|---|---|---|---|---|---|---|---|
| Écart (µm) |
Ces dix couples serviront encore au chapitre 10, qui leur ajustera une droite, et au chapitre 13, qui en fera un modèle statistique complet.
Le nuage se lit avant tout calcul. Les points montent de gauche à droite: le diamètre augmente avec l'usure, d'une quarantaine de micromètres en dix heures. Ils ne sont pas alignés — chaque pièce porte sa propre dispersion, celle qu'étudiait la première moitié de ce chapitre —, mais ils se regroupent autour d'une tendance qui a l'air rectiligne. C'est cette impression que les deux nombres suivants vont chiffrer.
Covariance et coefficient de corrélation empiriques
Le diviseur est celui de la variance (9.5), pour la même raison; il disparaît de toute façon dans , où il figure au numérateur et au dénominateur. La seconde écriture de , sans aucun diviseur, est celle que l'on calcule. On notera dans la suite
de sorte que . Comme pour la variance, une forme de König–Huygens évite de centrer chaque valeur: en développant le produit, .
Le signe se lit sur le nuage. Le terme est positif quand le point est à la fois à droite et au-dessus du point moyen, ou à la fois à gauche et en dessous; il est négatif dans les deux autres quadrants. La covariance est la somme de ces contributions: elle est positive quand le nuage occupe surtout les quadrants «+», c'est-à-dire quand les deux caractères ont tendance à varier dans le même sens. C'est exactement ce que montre la figure 9.3.
Ces deux nombres sont les analogues observés de et de du chapitre 7, et leurs propriétés se transportent sans changement.
Démonstration. Posons et , deux vecteurs de , non nuls par hypothèse. Alors , et , donc
est le cosinus de l'angle entre et . L'inégalité de Cauchy–Schwarz, , donne le point 1, et son cas d'égalité — et colinéaires, avec puisque — s'écrit pour tout : les points sont sur la droite de pente passant par le point moyen, et . Pour le point 3, les translations et disparaissent au centrage, donc et , d'où .
On peut aussi voir ce théorème comme un cas particulier du théorème 7.10: si l'on tire un des couples au hasard, avec probabilité chacun, on obtient un couple aléatoire dont le coefficient de corrélation est exactement — les diviseurs se simplifient. L'inégalité est donc l'inégalité de Cauchy–Schwarz du chapitre 7 appliquée à la loi uniforme sur le nuage.
Dans l'essai d'usure, on remplace l'écart au nominal (en µm) par le diamètre (en mm), et la durée (en heures) par le temps restant avant la fin du poste, . Que devient le coefficient de corrélation?
Ce que le coefficient de corrélation ne dit pas
Un seul nombre résume ici un nuage entier, et il le fait au prix de trois angles morts qu'il faut connaître.
ne mesure que le lien linéaire. Le chapitre 7 l'a montré sur une loi: si est uniforme sur et , alors alors que est une fonction exacte de . Il en va de même pour un nuage: des points disposés en arc parfait peuvent avoir un nul. Inversement, un élevé ne prouve pas que la relation est une droite: une courbe régulière et monotone donne un proche de .
est très sensible aux points aberrants, pour la même raison que la moyenne et l'écart-type de la première moitié du chapitre: il est construit sur des sommes de produits d'écarts, où chaque point pèse en proportion de son éloignement.
ne dit rien de la causalité. La section «Corrélation et causalité» du chapitre 7 a décrit les trois mécanismes — cause commune, inversion du sens, sélection — qui produisent une corrélation sans lien de cause à effet; ils valent mot pour mot pour un coefficient observé. Dans l'essai d'usure, si nous croyons que l'usure cause la dérive, ce n'est pas parce que : c'est parce que la mécanique de la coupe l'explique (un outil usé enlève moins de matière sur un diamètre extérieur) et parce que l'essai a été conduit dans des conditions contrôlées, sans autre changement que le temps. Notez d'ailleurs que le temps est ici un suspect commode: tout ce qui dérive pendant les dix heures — la température de la broche, un lot de matière — serait corrélé de la même façon avec . Un quatrième piège s'ajoute pour les données observées: mélanger deux groupes peut créer une corrélation qui n'existe dans aucun des deux, ou inverser le signe de celle qui existe dans chacun. Deux machines dont l'une produit des pièces plus grosses et tourne plus longtemps donneraient, mises ensemble, une corrélation «durée–diamètre» due au seul mélange.
Calculez le coefficient de corrélation empirique de la série double , , , , .
La question suivante est naturelle: quelle droite résume le mieux le nuage? Le chapitre 10 y répond par la méthode des moindres carrés, et le chapitre 13 en fait un modèle probabiliste, avec ses intervalles de confiance et ses tests.
De la description à l'inférence: le modèle de l'échantillon
Tout ce qui précède est du calcul sur quarante nombres et ne suppose rien. Nous voulons maintenant dire quelque chose de la machine, pas seulement des quarante pièces. Pour cela, il faut un modèle probabiliste, et il tient en une phrase.
Les deux hypothèses méritent qu'on les pèse. Même loi signifie que la machine ne dérive pas pendant le prélèvement: si l'outil s'use et que le diamètre augmente de pièce en pièce, la troisième et la trente-huitième n'ont pas la même loi, et tout ce qui suit s'écroule. Indépendance signifie que le diamètre d'une pièce ne renseigne pas sur celui de la suivante: c'est raisonnable si l'on prélève au hasard dans un bac, douteux si l'on prélève quarante pièces consécutives à la sortie de la machine, et faux si un copeau bloqué affecte une série de pièces d'affilée. En pratique, on obtient l'indépendance par la méthode de prélèvement — tirage au hasard dans la production d'une période —, jamais par décret.
Une manière imagée de se représenter la loi d'échantillonnage: imaginons que l'atelier prélève, non pas un échantillon de pièces, mais mille échantillons de pièces, et calcule mille moyennes. Ces mille nombres formeraient une série, avec sa propre moyenne, sa propre dispersion, sa propre forme. La loi d'échantillonnage de est la loi limite de cette série lorsqu'on répète l'opération indéfiniment. Elle existe que l'on fasse ou non l'expérience — et le paragraphe suivant la calcule exactement, sans rien prélever du tout.
Lois d'échantillonnage
Espérance et variance de la moyenne empirique
Démonstration. L'espérance est linéaire (chapitre 3), sans aucune hypothèse d'indépendance:
Pour la variance, et, les étant indépendantes donc non corrélées, la variance d'une somme est la somme des variances (chapitre 7):
Lisez bien où l'indépendance a servi et où elle n'a pas servi: ne demande rien, la formule de la variance demande seulement que les soient non corrélées. C'est important en pratique: un prélèvement légèrement dépendant ne déplace pas le centre, mais il fausse la précision — et il la fausse presque toujours dans le mauvais sens, en la surestimant.
La formule est le nombre le plus utile de tout le cours de statistique. Elle dit que la précision d'une moyenne s'améliore comme la racine carrée de l'effort: quadrupler la taille de l'échantillon divise l'erreur type par , la centupler la divise par . Pour l'atelier, avec mm:
| 1 | 4 | 16 | 40 | 64 | 121 | |
|---|---|---|---|---|---|---|
| (mm) | 0,0550 | 0,0275 | 0,0138 | 0,0087 | 0,0069 | 0,0050 |
La loi exacte dans le cas normal, la loi approchée sinon
Démonstration. Le point 1 résulte de la stabilité de la loi normale par combinaison linéaire (chapitre 6): une somme de variables normales indépendantes est normale, et le théorème 9.2 donne ses deux paramètres. Le point 2 est exactement le théorème central limite du chapitre 8, réécrit avec la notation .
Le point 1 mérite d'être savouré: dans le cas normal, il n'y a aucune approximation et aucune condition sur . La moyenne de deux pièces normales est normale. Le point 2 en revanche est une limite, et «assez grand» dépend de la loi de départ: est la règle d'atelier usuelle, mais elle est optimiste pour une loi très asymétrique (une exponentielle demande plutôt ) et beaucoup trop prudente pour une loi déjà presque symétrique (une uniforme donne une excellente approximation dès ). Le chapitre 8 discute ces ordres de grandeur.
La variance empirique est sans biais
Démonstration. L'identité algébrique de départ est une décomposition de la somme des carrés autour de :
le double produit étant nul puisque . On en tire
Prenons l'espérance des deux membres. À gauche rien à faire; à droite, pour chaque , et par le théorème 9.2, puisque . Donc
et en divisant par on obtient .
La démonstration montre d'où vient le : la somme des carrés autour de est en moyenne plus petite que celle autour de , exactement de , c'est-à-dire d'un , c'est-à-dire d'un terme sur . On dit qu'on a «perdu un degré de liberté» en estimant par : les écarts sont liés par une relation (leur somme est nulle), il n'y en a donc que de libres. Cette comptabilité des degrés de liberté gouvernera tout le reste du cours.
Le cas normal: khi-deux, indépendance, Student
Les résultats précédents ne supposent rien sur la forme de la loi. Si l'on ajoute l'hypothèse de normalité, on obtient beaucoup plus: la loi exacte de , et surtout la loi exacte du rapport qui servira aux chapitres 11 et 12.
Admis. Les deux affirmations demandent un changement de variables orthogonal en dimension (une transformation de Helmert) et le calcul du jacobien associé, outils d'algèbre linéaire et de calcul intégral à plusieurs variables qui dépassent le cadre de ce cours. Voici toutefois la raison, qui elle est compréhensible. Écrivons
qui n'est autre que l'identité de la démonstration du théorème 9.4, divisée par . Le membre de gauche est une somme de carrés de normales centrées réduites indépendantes, donc un . Le second terme de droite est le carré d'une par (9.9), donc un . Si l'on admet que les deux termes de droite sont indépendants, l'additivité des degrés de liberté du khi-deux impose que le premier soit un : il reste degrés de liberté une fois qu'on en a dépensé un pour localiser .
Quant à l'indépendance elle-même, elle est propre à la loi normale et elle n'a rien d'évident — est calculée à partir des mêmes données que . On peut la rendre plausible ainsi: est la projection du vecteur sur la direction , et est le carré de la norme de ce qu'il en reste, c'est-à-dire de sa projection sur l'hyperplan orthogonal. Or un vecteur gaussien de composantes indépendantes et de même variance a une loi invariante par rotation, donc ses projections sur deux sous-espaces orthogonaux sont indépendantes. Aucune autre famille de lois n'a cette propriété.
Démonstration. Divisons numérateur et dénominateur par :
où par (9.9). Le radicande est avec par (9.12), et et sont indépendantes puisque et le sont. La définition (9.13) avec conclut.
C'est le théorème qui rend la statistique praticable. Sans lui, la quantité est bien normale, mais elle contient , que l'on ne connaît jamais. En remplaçant par , on introduit une seconde source d'aléa — le dénominateur devient lui aussi une variable aléatoire — et la loi cesse d'être normale: elle s'épaissit aux extrémités, exactement de ce qu'il faut. Numériquement, sur nos données, au lieu de : la marge à payer pour ignorer est ici de . C'est ce nombre qui produira, au chapitre 11, l'intervalle de confiance pour le centrage de la machine A.
Quand croît, se concentre autour de , le dénominateur de (9.13) tend vers et la loi de Student tend vers la normale:
| 1 | 2 | 5 | 10 | 20 | 30 | 39 | 60 | 120 | ||
|---|---|---|---|---|---|---|---|---|---|---|
| 12,706 | 4,303 | 2,571 | 2,228 | 2,086 | 2,042 | 2,023 | 2,000 | 1,980 | 1,960 |
La convergence est lente au début et rapide ensuite: au-delà de , l'écart à est inférieur à , ce qui justifie la vieille règle «grand échantillon: on peut prendre ». Pour en revanche, la loi de Student est la loi de Cauchy, qui n'a même pas d'espérance: deux observations ne permettent pas grand-chose.
On prélève un échantillon aléatoire simple de taille dans une population normale d'écart-type inconnu. Laquelle de ces affirmations est exacte?
Les trois lois dérivées de la normale
Les chapitres 10 à 13 n'utiliseront, en plus de la normale, que trois lois. Toutes trois se déduisent de variables normales indépendantes, toutes trois se lisent dans des tables (annexe A), et toutes trois portent un ou deux degrés de liberté qui sont, à chaque fois, le nombre d'informations libres restantes.
Le khi-deux , somme de carrés de normales centrées réduites indépendantes. Elle vit sur , elle est fortement asymétrique à droite pour petit et se symétrise quand grandit; son espérance est , sa variance , et son mode vaut pour . Sa densité est
Elle sert aux inférences sur une variance (chapitre 11), aux tests d'ajustement et d'indépendance (chapitre 12). Repères: , et — notez que ces deux dernières valeurs ne sont pas symétriques autour de , ce qui distingue le khi-deux de la normale et de Student.
La loi de Student , quotient d'une normale par la racine d'un khi-deux réduit indépendant. Elle est symétrique, en cloche, mais à queues plus épaisses que la normale: sa variance excède . Sa densité est
et elle tend vers la densité de quand . Elle sert dès que l'on remplace un inconnu par : intervalles de confiance et tests sur une moyenne (chapitres 11 et 12).
La loi de Fisher , quotient de deux khi-deux réduits indépendants:
Elle vit sur , elle est asymétrique à droite, et elle vérifie la relation utile , qui permet de ne tabuler que les quantiles supérieurs. Elle sert à comparer — donc à décider, au chapitre 12, si les deux machines de l'atelier dispersent de la même façon — et elle est l'outil de base de l'analyse de la variance. Deux liens à retenir: , et quand .
Les quantiles de ces trois lois ne s'expriment pas par des fonctions élémentaires: ils se lisent dans une table ou se calculent numériquement. L'annexe A donne les tables de , de , de et de , chacune accompagnée d'un exemple de lecture; toutes y ont été produites par intégration numérique, et les valeurs citées dans ce chapitre en proviennent.
Le diamètre d'une pièce suit . On prélève un échantillon aléatoire simple de pièces. Calculez l'écart-type de la moyenne empirique , en millimètres.
Synthèse
- La probabilité va du modèle aux données, la statistique des données au modèle. Le chapitre 9 décrit les données (première moitié), puis pose le modèle probabiliste qui rend l'inférence possible (seconde moitié); les chapitres 10, 11 et 12 estiment, encadrent et testent.
- Le type du caractère décide de tout: pas de moyenne sur un ordinal, pas de médiane sur un nominal, pas de tableau valeur par valeur sur un continu. Dans un histogramme, c'est l'aire des rectangles qui porte la fréquence — la hauteur est —, et cette règle n'est visible que lorsque les classes sont inégales, c'est-à-dire précisément quand on l'oublie.
- La moyenne utilise toute l'information numérique mais cède devant une seule valeur aberrante; la médiane et l'écart interquartile résistent. On publie les deux et l'on commente leur écart: signale une queue à gauche, comme sur l'échantillon A où et .
Un histogramme est tracé sur des classes de largeurs 5, 5 et 20 unités, d'effectifs respectifs 25, 40 et 35, sur 100 observations. Quelle est la hauteur du troisième rectangle en densité de fréquence?
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Douze interventions de maintenance ont duré, en minutes: , , , , , , , , , , , .
Une enquête porte sur interventions, dont les durées (en minutes) sont publiées ainsi:
| Classe | ||||
|---|---|---|---|---|
| Effectif | 12 | 30 | 36 | 22 |
- Compléter le tableau par les fréquences, les fréquences cumulées et les hauteurs correctes de l'histogramme.
- Quelle classe paraîtrait la plus importante si l'on portait les effectifs en ordonnée? Laquelle l'est réellement en densité?
Soit une série de moyenne et d'écart-type .
Soit un échantillon aléatoire simple issu d'une population d'espérance et de variance finies.
Le diamètre produit par la machine A est modélisé par avec mm. On prélève un échantillon aléatoire simple de pièces.
- Donner la loi exacte de et calculer .
Dans six communes (données fictives), on a relevé le nombre de pharmacies et le nombre de décès de l'année :
| Commune | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| Pharmacies |
Références
- Morgenthaler, S., Introduction à la statistique, 3e éd., Presses polytechniques et universitaires romandes, Lausanne — chapitres sur la statistique descriptive et l'échantillonnage.
- Dodge, Y., Statistique — dictionnaire encyclopédique, Springer, Paris — entrées «boîte à moustaches», «quantile», «coefficient d'asymétrie».
- Saporta, G., Probabilités, analyse des données et statistique, 3e éd., Technip, Paris — chapitres 1 et 2 pour la description, chapitre 10 pour les lois d'échantillonnage.
- Rice, J. A., Mathematical Statistics and Data Analysis, 3e éd., Duxbury, Belmont — chapitre 6, «Distributions derived from the normal distribution».
- Wackerly, D., Mendenhall, W. et Scheaffer, R., Mathematical Statistics with Applications, 7e éd., Cengage, Boston — chapitre 7, «Sampling distributions and the central limit theorem».
- Tukey, J. W., Exploratory Data Analysis, Addison-Wesley, Reading — l'ouvrage qui a introduit la boîte à moustaches et la règle des 1,5 écarts interquartiles.
- Anscombe, F. J., «Graphs in Statistical Analysis», The American Statistician, vol. 27, nº 1, 1973, p. 17–21 — l'article des quatre séries de même corrélation et de même droite, qui plaide pour regarder le nuage avant de calculer.