Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
- majorer une probabilité de queue par les inégalités de Markov et de Bienaymé–Tchebychev, et dire pourquoi ces bornes sont à la fois universelles et très lâches;
- énoncer la convergence en probabilité, démontrer la loi faible des grands nombres à partir de l'inégalité de Tchebychev, et distinguer la loi faible de la loi forte;
- reconnaître les situations où la loi des grands nombres ne s'applique pas, et estimer une quantité déterministe par la méthode de Monte-Carlo en connaissant la vitesse en ;
- énoncer le théorème central limite sous ses deux formes équivalentes (somme et moyenne), nommer ses hypothèses, et dire ce qu'il n'affirme pas;
- juger de la qualité de l'approximation normale selon la loi de départ et la taille de l'échantillon, et appliquer la correction de continuité à une loi entière;
- calculer complètement la marge d'erreur d'un sondage, le cumul d'un grand nombre d'erreurs de mesure et la réserve d'un portefeuille d'assurance.
Pourquoi ce chapitre est la charnière du cours
Les sept premiers chapitres ont construit un vocabulaire: un espace probabilisé, des variables aléatoires, quelques lois usuelles, une espérance, une variance, une covariance. Tout cela décrit une expérience. La statistique, elle, ne s'intéresse jamais à une expérience: elle observe répétitions et cherche à remonter au modèle. Entre les deux il manque un pont, et ce pont, ce sont les théorèmes limites: des énoncés qui décrivent le comportement de lorsque devient grand.
Ce chapitre en démontre ou en énonce trois. Les inégalités de Markov et de Tchebychev majorent une probabilité de queue sans rien savoir de la loi; elles sont grossières mais elles ne coûtent rien. La loi des grands nombres dit que la moyenne empirique se stabilise autour de l'espérance: c'est la justification de la phrase «la probabilité est une fréquence limite» qui a servi d'intuition depuis le chapitre 1, et c'est ce qui rend la statistique possible. Le théorème central limite dit bien davantage: il décrit la forme des fluctuations autour de cette limite, et cette forme est toujours la même — la gaussienne du chapitre 6 — quelle que soit la loi de départ. C'est ce dernier résultat qui donne aux chapitres 10 à 12 leurs intervalles de confiance et leurs tests.
Deux mots d'avertissement avant de commencer. D'abord, ces théorèmes sont asymptotiques: ils parlent de , et l'ingénieur travaille avec ou . Une bonne partie du chapitre consiste donc à mesurer à quelle vitesse l'approximation devient acceptable, chiffres à l'appui. Ensuite, ce sont les théorèmes les plus mal cités des mathématiques appliquées: la «loi des séries», la martingale du joueur et la phrase «avec 1000 personnes on connaît l'avis de huit millions» sont trois malentendus sur les trois énoncés. Nous les traiterons explicitement.
Les données numériques inventées de ce chapitre (portefeuille d'assurance, atelier, erreurs de mesure) sont des données fictives; les valeurs vérifiées par le calcul sont, elles, exactes et reproductibles.
Deux inégalités universelles
L'inégalité de Markov
Le point de départ est d'une simplicité désarmante: si une variable aléatoire est positive et que sa moyenne est petite, elle ne peut pas prendre souvent de grandes valeurs, sinon la moyenne serait grande. Cette phrase se quantifie exactement.
Démonstration. Introduisons l'indicatrice , qui vaut si et sinon. L'inégalité déterministe
est vraie pour toute réalisation: si , le membre de droite vaut et le membre de gauche lui est supérieur ou égal; si , le membre de droite vaut et le membre de gauche est positif ou nul par hypothèse. C'est ici, et seulement ici, que la positivité de sert. En prenant l'espérance des deux membres, et en utilisant la croissance de l'espérance puis sa linéarité (chapitre 3),
car l'espérance d'une indicatrice est la probabilité de l'événement qu'elle indique. On divise par .
L'hypothèse de positivité n'est pas décorative: pour une variable normale centrée, et (8.1) donnerait , ce qui est faux. En revanche, l'inégalité s'applique à , à , à — et c'est en la déclinant sur ces variables auxiliaires que l'on obtient les inégalités plus fines, dont celle de Tchebychev.
L'inégalité de Bienaymé–Tchebychev
Démonstration. La variable est positive ou nulle et son espérance vaut , par définition même de la variance (chapitre 3). Les deux événements
sont le même événement, puisque la fonction est croissante sur les positifs. L'inégalité de Markov appliquée à avec donne donc
L'énoncé (8.3) mérite qu'on s'y arrête: il affirme qu'aucune variable aléatoire de variance finie ne place plus de de sa masse au-delà de écarts-types de sa moyenne. Plus de de la masse est dans , plus de dans , et cela sans hypothèse de symétrie, de continuité ou d'unimodalité. C'est ce qui donne à l'écart-type son statut d'unité de mesure universelle de la dispersion, et c'est ce qui justifie rétrospectivement la règle des –– du chapitre 6: cette règle-là est propre à la loi normale, celle-ci vaut pour toutes les lois.
À quel point ces bornes sont-elles lâches?
Comparons systématiquement, sur le cas le plus favorable à la borne — une variable normale, parfaitement symétrique et sans queue épaisse.
| borne | vraie valeur pour | rapport | |
|---|---|---|---|
| 1 | 1 (sans contenu) | 0,3173 | — |
| 1,5 | 0,4444 | 0,1336 | 3,3 |
| 2 | 0,2500 | 0,0455 | 5,5 |
| 2,5 | 0,1600 | 0,01242 | 12,9 |
| 3 | 0,1111 | 0,002700 | 41 |
| 4 |
À deux écarts-types, la borne annonce et la réalité est de ; à quatre écarts-types, la borne est mille fois trop grande. Pire, pour elle ne dit rien du tout ().
Une variable aléatoire vérifie et . Que peut-on affirmer avec certitude?
La loi des grands nombres
Convergence en probabilité
Une suite de variables aléatoires n'a pas de limite au sens de l'Analyse I: à fixé on a bien une suite de nombres, mais c'est toute la famille de ces suites qu'il faut contrôler. Il existe donc plusieurs notions de convergence, et deux nous suffiront.
Lisons (8.4) mot à mot. On se donne une tolérance aussi petite qu'on veut; on regarde la probabilité que s'en écarte; on demande que cette probabilité tende vers zéro. Autrement dit: pour grand, il est très improbable que soit loin de . Ce n'est pas la même chose que dire que converge pour chaque : la convergence en probabilité autorise, à chaque rang , un petit ensemble d'issues où dérape, à condition que cet ensemble rétrécisse — et rien n'interdit qu'il se déplace d'un rang à l'autre, de sorte qu'une issue donnée soit épinglée une infinité de fois. Nous reviendrons sur ce point avec la loi forte.
La loi faible des grands nombres
Démonstration. Elle tient en trois lignes une fois Tchebychev disponible. Par linéarité de l'espérance,
Par la formule de la variance d'une somme de variables indépendantes, donc non corrélées (chapitre 7), et par ,
Il suffit alors d'appliquer l'inégalité de Tchebychev (8.2) à la variable , d'espérance et de variance :
qui tend vers quand , à fixé.
Tout le théorème est dans la relation (8.6), qui est le résultat le plus utilisé de tout le cours: la variance de la moyenne empirique est fois plus petite que celle d'une observation, donc son écart-type est . Cette quantité porte un nom, l' (ou erreur standard) de la moyenne; elle reviendra dans chacun des quatre derniers chapitres. Notez au passage que l'indépendance n'est utilisée que pour obtenir (8.6): la démonstration vaut donc telle quelle pour des variables seulement , hypothèse plus faible.
Deux lectures de cette figure. La première, encourageante: après lancers, la moyenne est à , l'espérance vaut , tout va bien. La seconde, plus instructive: la convergence est lente, et surtout elle n'est pas monotone. Entre et la courbe remonte, redescend, repasse au-dessus. L'axe logarithmique est indispensable ici: en échelle linéaire, tout ce qui se passe avant serait écrasé contre l'axe vertical, et l'on croirait à une convergence lisse qui n'existe pas.
La loi forte des grands nombres
Ce théorème est admis. La raison est précise, et elle n'est pas une dérobade: l'énoncé (8.7) porte sur la probabilité d'un événement qui concerne la suite entière , donc un événement de l'espace produit infini . Écrire comme une réunion et une intersection dénombrables d'événements, et montrer que l'objet obtenu est bien dans la tribu, relève de la théorie de la mesure — de même que les outils de la preuve (lemme de Borel–Cantelli, troncature, inégalité maximale de Kolmogorov). Ce sont les prérequis d'un cours de probabilités de deuxième cycle, pas de celui-ci. En revanche la version «à variance finie» due à Cantelli, qui suppose en plus , se démontre avec Markov appliqué à la puissance quatrième et le lemme de Borel–Cantelli: si vous rencontrez une démonstration «élémentaire» de la loi forte, c'est en général de celle-là qu'il s'agit.
Faible et forte: quelle différence, vraiment?
La distinction est classiquement escamotée. Prenons le temps de la dire.
La loi faible affirme que, pour chaque grand, l'ensemble des issues pour lesquelles s'écarte de de plus de est de petite probabilité. Elle ne dit rien de ce qui relie ces ensembles d'un rang à l'autre. Imaginez une salle de mille personnes lançant chacune sa pièce: la loi faible dit qu'à chaque instant, très peu de gens ont une fréquence aberrante. Elle n'interdit pas qu'il s'agisse, à chaque instant, de gens différents — et donc que chacun, au cours de sa vie, connaisse une infinité d'instants aberrants.
La loi forte interdit exactement cela. Elle affirme que si l'on fixe une personne — une issue — et qu'on la suit indéfiniment, sa suite de moyennes converge vers au sens ordinaire de l'Analyse I, à un ensemble d'issues de probabilité nulle près. Chaque joueur, sauf un ensemble exceptionnel de mesure nulle, ne connaît qu'un nombre fini d'instants aberrants.
La loi forte implique la loi faible; la réciproque est fausse, et l'on sait construire des suites qui convergent en probabilité sans converger presque sûrement. Pour l'utilisateur, la conséquence pratique est celle-ci: la loi faible garantit qu'un sondage de taille a peu de chances de se tromper; la loi forte garantit qu'une simulation qu'on laisse tourner finira par donner la bonne valeur et n'en ressortira plus. C'est la loi forte qui fonde la méthode de Monte-Carlo, et c'est elle qui donne son sens à l'interprétation fréquentiste de la probabilité: la fréquence d'un événement sur une longue série converge, pour la série elle-même et pas seulement en probabilité.
Une pièce équilibrée a donné 470 piles en 1000 lancers. On effectue 4000 lancers supplémentaires qui donnent exactement leur espérance. Quelle est alors la fréquence de pile sur l'ensemble des 5000 lancers?
Quand la loi des grands nombres n'existe pas: la loi de Cauchy
Le théorème 8.4 demande une hypothèse, et une seule: que existe. Le chapitre 5 a exhibé une loi pour laquelle elle n'existe pas, la loi de Cauchy standard, de densité
dont l'intégrale diverge parce que décroît seulement comme . La loi est pourtant symétrique, unimodale, parfaitement respectable d'allure. Que devient la moyenne empirique?
On simule variables de Cauchy par la méthode de l'inverse du chapitre 5, avec uniforme sur , en Python avec — la graine est donnée pour que le tableau soit reproductible à l'identique.
| (Cauchy) | (normale, même graine) | |
|---|---|---|
| 1 | −0,094 | −1,586 |
| 10 | 0,285 | −0,046 |
| 50 | 18,637 | — |
| 100 | 12,966 | 0,153 |
| 500 | −8,369 | — |
| 1 000 | −3,479 |
La colonne de droite fait ce que l'on attend: elle se colle à et y reste. La colonne de gauche, elle, ne converge pas: elle est à au rang , revient près de au rang et repart à au rang . Ce n'est pas un défaut de la simulation. On démontre que si sont i.i.d. de Cauchy standard, alors suit la loi de Cauchy standard, pour tout : moyenner observations n'apporte strictement rien. Le coupable est visible dans la simulation: le plus grand terme rencontré vaut , au rang , et il déplace à lui seul la moyenne de . Dans une loi à queue lourde, un seul terme peut dominer la somme de tous les autres, et c'est précisément ce que interdit.
Parmi ces affirmations sur la loi des grands nombres, laquelle est correcte?
La méthode de Monte-Carlo
La loi des grands nombres se lit dans les deux sens. Dans un sens, elle dit que la moyenne d'un échantillon approche une espérance inconnue: c'est la statistique. Dans l'autre, elle dit qu'on peut approcher une espérance connue mais difficile à calculer en simulant l'échantillon: c'est la méthode de Monte-Carlo, née à Los Alamos à la fin des années 1940 avec les travaux de Metropolis et Ulam.
Le principe. Pour calculer une quantité déterministe , on l'écrit comme une espérance pour une variable que l'on sait simuler, on tire indépendantes, et l'on estime
L'exemple canonique est le calcul de . Tirons un point uniformément dans le carré et posons . L'espérance de est l'aire du quart de disque, soit ; donc estime . Voici le résultat d'une simulation unique de points, lue à quatre étapes, avec Python et :
| points dans le disque | estimation de | erreur | écart-type théorique | |
|---|---|---|---|---|
| 100 | 71 | 2,8400 | 0,3016 | 0,1642 |
| 1 000 | 797 | 3,1880 | 0,0464 | 0,0519 |
| 10 000 | 7 888 | 3,1552 | 0,0136 | 0,0164 |
| 100 000 | 78 405 | 3,1362 | 0,0054 | 0,0052 |
L'écart-type théorique se calcule sans simulation: suit une loi de Bernoulli de paramètre , donc a pour écart-type
Les erreurs observées sont cohérentes avec ces écarts-types — sauf à , où l'erreur vaut écart-type; cela arrive environ une fois sur quinze, et il aurait été malhonnête de relancer la simulation jusqu'à obtenir un tableau plus flatteur.
Le message central est dans la dernière colonne, et il est décevant: l'erreur décroît comme . Multiplier par ne gagne qu'un facteur sur la précision, c'est-à-dire une décimale. Le tableau le montre: pour passer de deux décimales exactes à trois, il faudrait environ points au lieu de . Une méthode de quadrature classique sur une intégrale en dimension un fait infiniment mieux (erreur en ou ).
Pourquoi alors utiliser Monte-Carlo? Parce que la vitesse de (8.9) ne dépend pas de la dimension. Une quadrature à points par axe coûte évaluations en dimension ; passé ou , elle devient impraticable, alors que Monte-Carlo continue d'avancer à la même allure décevante mais constante. C'est ce qui fait de la simulation l'outil standard de la finance quantitative, de la physique des particules et du rendu d'images.
Une estimation de Monte-Carlo a une erreur type de avec tirages. Combien de tirages faut-il pour ramener cette erreur type à ?
Le théorème central limite
La loi des grands nombres dit que tend vers . C'est une information appauvrie: elle ne dit rien de la taille ni de la forme de cet écart résiduel. Or la relation (8.6) nous donne déjà la taille: l'écart-type de vaut . L'idée du théorème central limite est de regarder l'écart à cette échelle-là — de le diviser par , ce qui empêche à la fois de s'effondrer sur et d'exploser — et de constater que ce qui reste a toujours la même loi.
Les deux écritures (8.10) et (8.11) sont la même relation: le numérateur et le dénominateur de la première ont simplement été multipliés par . On passe de l'une à l'autre selon que le problème parle d'une moyenne (un sondage, une mesure répétée) ou d'un total (un cumul d'erreurs, une charge, un montant de sinistres). En pratique on les utilise sous la forme approchée
le symbole signifiant «suit approximativement, pour grand». Remarquez la variance de la somme: , donc un écart-type en . La somme se disperse, la moyenne se concentre, et le rapport entre les deux est le facteur .
Ce théorème est admis. La démonstration standard passe par les fonctions caractéristiques : on montre que la fonction caractéristique de la somme standardisée est , on développe à l'ordre deux au voisinage de — c'est là qu'intervient la variance finie — pour obtenir , qui est la fonction caractéristique de , et l'on conclut par le , qui garantit que la convergence des fonctions caractéristiques entraîne celle des lois. Les deux ingrédients manquants sont donc l'intégration de fonctions à valeurs complexes et le théorème de Lévy, dont la preuve relève de la théorie de la mesure. Le mécanisme, lui, est parfaitement lisible: la limite ne dépend de la loi de départ que par et , puisque seuls les deux premiers termes du développement survivent. C'est cela, l'universalité de la gaussienne.
Les hypothèses, une par une
- Indépendance. Elle peut être affaiblie (il existe des versions pour des suites faiblement dépendantes, des martingales, des champs mélangeants), mais elle ne peut pas être supprimée. Une somme de variables fortement dépendantes n'a aucune raison d'être normale.
- Même loi. Elle aussi peut être affaiblie: le théorème de Lindeberg–Feller remplace «même loi» par une condition qui exige qu'aucun terme ne domine les autres. Cette condition est l'essentiel: le théorème central limite décrit ce qui se passe quand beaucoup de petites contributions comparables s'additionnent. C'est la raison profonde pour laquelle tant de grandeurs mesurées (erreurs d'instrument, bruits électroniques, tailles dans une population homogène) sont approximativement normales — et aussi pourquoi certaines ne le sont pas du tout: quand une contribution domine, la somme garde sa forme.
- Variance finie. Indispensable, et c'est elle qui tombe pour la loi de Cauchy. Pour des lois à queue lourde d'indice , la somme standardisée converge vers une loi stable non gaussienne; le théorème central limite est un cas particulier d'une théorie plus large.
- . Sinon la variable est constante et il n'y a rien à standardiser.
La figure 8.3 est une démonstration visuelle de l'universalité. La loi de départ est uniforme sur , c'est-à-dire plate, discrète, sans le moindre air de cloche. Additionner deux tirages produit un triangle; en additionner cinq produit une courbe déjà presque gaussienne. Aucune simulation n'intervient: les probabilités du panneau du bas sont les fractions exactes issues de la convolution, par exemple , contre pour la densité normale correspondante.
Histogramme de la moyenne standardisée Zₙ = (X̄ₙ − μ)/(σ/√n) d'un échantillon de taille n, avec la densité de la loi normale centrée réduite superposée. Les lois sont calculées exactement, sans simulation: convolution répétée pour le dé, loi binomiale pour la Bernoulli, loi Gamma(n, 1) pour l'exponentielle. L'écart maximal à Φ est la distance de Kolmogorov entre la loi exacte de Zₙ et la loi normale; regardez-la décroître, et regardez la Bernoulli p = 0,2 — la plus asymétrique — traîner derrière les deux autres.
L'explorateur ci-dessus généralise la figure 8.3 à trois lois de départ et à toute taille d'échantillon jusqu'à . Les trois lois sont traitées exactement, sans simulation: convolution répétée pour le dé, formule binomiale pour la Bernoulli, loi pour la somme d'exponentielles. Le readout «écart maximal à » est la distance de Kolmogorov entre la loi exacte de et la loi normale, c'est-à-dire : c'est lui qu'il faut regarder décroître. Le readout «asymétrie» donne , où est l'asymétrie de la loi de départ ( pour le dé, pour la Bernoulli de paramètre , pour l'exponentielle); il explique l'ordre dans lequel les trois lois convergent. Enfin, la moyenne et la variance de restent et quels que soient la loi et — c'est la standardisation qui le garantit, avant tout théorème limite; ce qui change avec , c'est uniquement la .
Remettez dans l'ordre les étapes du raisonnement qui mène de la loi des grands nombres au théorème central limite.
Glissez les éléments pour les mettre dans le bon ordre
- On standardise: a pour espérance 0 et pour variance 1, quel que soit
- La loi de tend vers , quelle que soit la loi de départ de variance finie
- L'écart-type de cet écart vaut : c'est la bonne échelle pour le regarder
- Par l'inégalité de Tchebychev, converge en probabilité vers : l'écart tend vers 0
- La moyenne empirique a pour espérance et pour variance
Vitesse et qualité de l'approximation
«Pour grand» n'est pas une instruction exécutable. Mesurons donc l'erreur commise. L'indicateur naturel est la distance de Kolmogorov
l'écart maximal entre la vraie fonction de répartition de la somme standardisée et celle de la loi normale. Le tableau suivant la donne pour trois lois de départ; toutes les valeurs sont exactes (loi d'Irwin–Hall en arithmétique décimale à 300 chiffres pour la somme d'uniformes, loi Gamma pour la somme d'exponentielles, loi binomiale pour la somme de Bernoulli), calculées avec Python.
| avec correction | ||||
|---|---|---|---|---|
| 1 | 0,0572 | 0,1587 | 0,3413 | 0,0228 |
| 2 | 0,0164 | 0,0945 | 0,2500 | 0,0170 |
| 5 | 0,0057 | 0,0596 | 0,1726 | 0,0056 |
| 10 | 0,0028 | 0,0421 | 0,1230 | 0,0027 |
| 30 | 0,00092 | 0,0243 | 0,0722 | 0,00092 |
| 100 | 0,00028 | 0,0133 | 0,0398 | 0,00027 |
Trois lectures.
La loi uniforme converge très vite. Dès , l'erreur maximale est de six millièmes; à , de neuf dix-millièmes. Mieux, la colonne décroît comme et non comme : le rapport entre et est de , exactement le rapport des . La raison est la : le terme d'ordre du développement d'Edgeworth est proportionnel à l'asymétrie , qui est nulle ici, et le premier terme survivant est d'ordre . Une loi de départ symétrique offre gratuitement une décimale de plus.
La loi exponentielle converge lentement. Elle est asymétrique () et sa colonne décroît, elle, exactement comme : , , . La constante est stable sur trois décades. À — le seuil de la règle de pouce — l'erreur maximale vaut encore points de pourcentage, ce qui est beaucoup si l'on cherche à distinguer un risque de d'un risque de .
La loi de Bernoulli paraît catastrophique, et c'est un artefact. Sa fonction de répartition est un escalier dont les marches ont pour hauteur , alors que est continue: au voisinage d'une marche, l'écart ne peut pas descendre en dessous de la moitié de sa hauteur, soit environ . La troisième colonne mesure donc essentiellement la de la loi, pas la qualité du théorème central limite. La dernière colonne, obtenue en comparant non pas au sommet de la marche mais évaluée de la marche, est du même ordre que celle de la loi uniforme. Ce déplacement d'un demi-pas porte un nom: c'est la correction de continuité, et c'est l'objet de la section suivante.
Berry–Esseen: la vitesse générale est en un sur racine de n
Le tableau ci-dessus n'est pas une coïncidence: il illustre un théorème.
Nous n'en donnons ni la démonstration ni la meilleure constante connue. Retenez trois choses. La vitesse est en , la même lenteur que Monte-Carlo, et pour la même raison. Le facteur mesure l'asymétrie et l'épaisseur des queues de la loi de départ: il vaut pour la loi uniforme, pour la Bernoulli symétrique, pour l'exponentielle et pour la Bernoulli de paramètre — ce qui ordonne exactement les colonnes du tableau. Enfin la borne (8.13) est dans les cas usuels: avec les valeurs de publiées (toutes inférieures à ; on sait par ailleurs que ne peut pas descendre en dessous d'environ ), elle donne pour l'exponentielle à une majoration d'environ alors que l'erreur réelle est de . C'est une garantie, pas une estimation — la même philosophie que Tchebychev, un cran plus haut.
Le dernier point pratique: la borne (8.13) porte sur le sup, donc sur le pire , lequel se trouve près du centre. Dans les queues, l'erreur absolue est plus petite mais l'erreur relative explose. Pour la somme de exponentielles, l'approximation normale de donne contre en vérité — une erreur de — mais l'approximation d'une probabilité de l'ordre de peut être fausse d'un facteur deux. En fiabilité, on ne calcule pas une probabilité de défaillance rare avec le théorème central limite.
Deux probabilités, vraie et approchée
Pour fixer les idées sur des nombres directement lisibles, voici la probabilité exacte de l'événement , à comparer à :
| somme d'uniformes | somme d'exponentielles | |
|---|---|---|
| 1 | 0,7887 | 0,8647 |
| 2 | 0,8249 | 0,8548 |
| 5 | 0,8362 | 0,8475 |
| 10 | 0,8388 | 0,8446 |
| 30 | 0,8405 | 0,8425 |
| 100 | 0,8411 | 0,8417 |
Les deux colonnes convergent vers , l'une par en dessous et l'autre par au-dessus — la loi exponentielle, étalée vers la droite, met trop de masse à gauche de son centre — et la colonne de gauche est en avance d'une décimale sur celle de droite à tous les rangs.
L'approximation normale de la binomiale, bouclée
Le chapitre 6 a introduit l'approximation normale de la loi binomiale comme une recette, avec sa correction de continuité et sa règle d'emploi. Nous pouvons maintenant la démontrer: c'est un cas particulier du théorème central limite.
Soit . Par définition, où les sont des variables de Bernoulli indépendantes de paramètre (chapitre 4), donc i.i.d. avec et , tous deux finis. La forme (8.11) du théorème 8.5 s'applique mot pour mot:
C'est le théorème de de Moivre–Laplace, établi par de Moivre en 1733 pour et étendu par Laplace: historiquement, le premier théorème central limite, un siècle et demi avant le cas général.
Reste la difficulté propre au cas discret, identifiée à la section précédente: prend des valeurs entières, la loi normale est continue. L'événement est le même que pour la binomiale, mais pas pour la normale. La correction de continuité consiste à remplacer chaque entier par l'intervalle avant d'appliquer l'approximation:
Soit . Calculez par l'approximation normale avec correction de continuité.
Trois applications, entièrement chiffrées
La marge d'erreur d'un sondage
Un institut interroge personnes tirées au hasard et déclarent voter oui. La proportion observée est . Que vaut la proportion dans la population entière?
Modélisons: si la -ième personne dit oui, sinon, les étant i.i.d. de Bernoulli de paramètre inconnu. Alors , et le théorème central limite donne, par (8.12),
En remplaçant par son estimation dans l'écart-type — une substitution que le chapitre 11 justifiera —, l'erreur type vaut
Le quantile , obtenu par bissection sur et non de mémoire, donne la demi-largeur
soit un intervalle de confiance à
La «marge d'erreur de 3 points» annoncée par la presse est exactement ce nombre: points de pourcentage. Elle n'a rien d'un usage ni d'une convention: c'est , et elle sort du théorème central limite. On retrouve d'ailleurs la majoration commode , qui donne une demi-largeur toujours inférieure à : d'où la règle de pouce «marge » des salles de rédaction, ici .
Trois lectures que ce nombre impose.
L'intervalle contient . On ne peut donc pas conclure que le oui est majoritaire. C'est la conclusion la plus fréquente et la plus mal reçue des sondages serrés. Si la vraie proportion était exactement , la probabilité d'observer serait pour , soit — un événement qui se produit une fois sur neuf.
La taille de la population n'intervient pas. Ni ni la marge ne dépendent du nombre d'électeurs: le même échantillon de personnes donne la même précision pour un canton de habitants et pour la Suisse entière. Cela surprend, et c'est pourtant la conséquence directe de (8.6), où seule apparaît. La correction pour population finie ne devient sensible que si l'échantillon dépasse quelques pour cent de la population.
La marge ne couvre que l'aléa d'échantillonnage. Elle ne dit rien des refus de répondre, des personnes injoignables, de la formulation de la question ou des électeurs qui changent d'avis. Ces biais-là ne se réduisent pas en augmentant : un sondage biaisé de personnes a une marge d'erreur minuscule autour de la mauvaise valeur. Le chapitre 9 y revient sous le nom de biais de sélection.
Cent erreurs de mesure
Un atelier empile cales usinées. Chaque cale porte une erreur de longueur que l'on modélise (données fictives) par une loi uniforme sur mm, les erreurs étant indépendantes. Quelle est l'erreur totale de la pile?
La somme a pour espérance et, par (8.6) appliquée à la somme,
Par le théorème central limite, , d'où
La valeur exacte, obtenue par la loi d'Irwin–Hall en arithmétique décimale de haute précision, est : l'approximation est juste à la sixième décimale. Ce n'est pas un hasard — la loi uniforme est symétrique, et nous avons vu que sa convergence est en .
Deux enseignements d'atelier. D'abord, l'erreur totale n'est pas mm dans le pire des cas envisageable en pratique: à , elle est inférieure à mm en valeur absolue. Les erreurs indépendantes se compensent partiellement, et le cumul croît en , pas en . Ensuite, cette compensation suppose l' et une espérance nulle. Si la machine dérive et que chaque cale est trop longue de mm en moyenne, ce biais-là s'additionne linéairement: mm de trop, systématiquement, et aucune racine carrée ne vient au secours. C'est la différence entre erreur aléatoire et erreur systématique, et elle est tout entière dans la différence entre et .
La file d'attente et le portefeuille d'assurance
Le centre d'appels. Reprenons appels par minute. Sur une heure, le nombre total d'appels est avec indépendantes, donc et (la somme de lois de Poisson indépendantes est une Poisson de paramètre la somme, chapitre 4). Combien de postes prévoir?
Si chaque opérateur traite appels à l'heure, le seuil à ne pas dépasser est fixé par le quantile: à ,
soit opérateurs. Vérifions l'approximation: vaut exactement par la loi de Poisson, et l'approximation normale avec correction de continuité donne — trois centièmes de point d'écart, sur une loi discrète et asymétrique.
Le portefeuille d'assurance. Un assureur (données fictives) couvre vélos. Le coût annuel d'un contrat a pour espérance CHF 200 et pour écart-type CHF 1500 — une loi très asymétrique, la plupart des contrats ne coûtant rien et quelques-uns coûtant beaucoup. On ne connaît pas cette loi, et ce n'est pas nécessaire: seuls et entrent dans le théorème central limite.
Le coût total vérifie
L'assureur veut un capital tel que . Par (8.12),
soit une prime de CHF 234,90 par contrat: la prime pure de CHF 200 plus un chargement de sécurité de CHF 34,90, c'est-à-dire . Avec contrats, le même calcul donne CHF 211,03: le chargement tombe à . Voilà, en une ligne, le principe de la mutualisation: l'espérance croît comme , l'incertitude comme , donc le chargement décroît comme . C'est le théorème central limite qui fait tenir l'industrie de l'assurance debout, et c'est aussi lui qui indique où elle est fragile — le calcul suppose l'indépendance des sinistres, hypothèse qui s'effondre exactement le jour d'une grêle, d'une inondation ou d'une épidémie, c'est-à-dire le jour où l'assureur en a besoin.
Ce que les chapitres 9 à 12 en feront
Ce chapitre était le dernier de la partie «probabilités». Tout ce qui suit en est l'exploitation.
- Le chapitre 9 définit l'échantillon aléatoire et les lois d'échantillonnage; la relation (8.6) y devient la définition de l'erreur type, et le théorème central limite y justifie que soit approximativement normale même pour des données qui ne le sont pas.
- Le montre que est un estimateur sans biais et de : convergent, c'est-à-dire exactement ce que dit la loi des grands nombres, dans le vocabulaire des estimateurs.
Une seule relation, , et un seul théorème, le théorème 8.5, portent donc les quatre derniers chapitres. Si vous ne deviez retenir que deux formules de ce cours, ce seraient celles-là.
Synthèse
- Markov ( pour ) et Bienaymé–Tchebychev () majorent une probabilité de queue à partir de l'espérance et de la variance seules. Elles sont universelles et très lâches: annoncés contre réels à deux écarts-types dans le cas normal. On s'en sert pour démontrer, pas pour calculer.
À quelle condition l'inégalité de Markov est-elle valable?
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Soit , loi exponentielle d'espérance et d'écart-type (chapitre 6).
- Majorez par l'inégalité de Markov, puis par celle de Bienaymé–Tchebychev, puis calculez la valeur exacte.
Une chaîne produit des pièces dont une proportion est défectueuse. On prélève pièces au hasard et l'on note la fréquence observée de défectueuses.
- Donnez l'espérance et la variance de .
Une pile est formée de cales. L'erreur de longueur de chaque cale suit une loi uniforme sur mm, indépendamment des autres (données fictives).
- Donnez l'espérance et l'écart-type de l'erreur totale .
- Calculez par le théorème central limite.
- Déterminez la tolérance telle que .
Un institut interroge personnes; répondent oui.
- Calculez l'intervalle de confiance à pour la proportion et exprimez la demi-largeur en points de pourcentage.
- En supposant , calculez par l'approximation normale avec correction de continuité, puis exactement.
Soit une variable aléatoire d'espérance et de variance finies. On veut démontrer que, pour tout ,
Références
- Ross, S., Initiation aux probabilités, Presses polytechniques et universitaires romandes, Lausanne — chapitre sur les théorèmes limites, avec la démonstration par les fonctions génératrices des moments.
- Morgenthaler, S., Introduction à la statistique, Presses polytechniques et universitaires romandes, Lausanne — le passage des probabilités à l'inférence.
- Saporta, G., Probabilités, analyse des données et statistique, Technip, Paris — convergences de suites de variables aléatoires et lois limites.
- Rice, J. A., Mathematical Statistics and Data Analysis, Duxbury, Belmont — traitement détaillé de la qualité de l'approximation normale.
- Wackerly, D., Mendenhall, W. et Scheaffer, R., Mathematical Statistics with Applications, Cengage, Boston — chapitre sur les distributions d'échantillonnage et l'approximation normale de la binomiale.
- Dodge, Y., Statistique — dictionnaire encyclopédique, Springer, Paris — entrées «loi des grands nombres», «théorème central limite», «inégalité de Tchebychev».