Ce formulaire rassemble, chapitre par chapitre, les définitions, les formules et les théorèmes essentiels du cours, avec la notation des chapitres correspondants: les numéros d'équations et de théorèmes y renvoient directement. Chaque formule est suivie de la signification des symboles et de ses conditions de validité; les démonstrations, les exemples chiffrés et les pièges classiques restent dans les chapitres. Conventions du cours: décimales à la virgule (), en romain, avec la variance en second paramètre, toujours avec le diviseur , quantiles indexés par leur ordre (, donc ), majuscule pour un estimateur et minuscule pour l'estimation qu'il produit.
Chapitre 1 – Espaces probabilisés et dénombrement
Les trois axiomes de Kolmogorov sur un espace probabilisable , où est une tribu: positivité, normalisation et -additivité (1.2). Le triplet est un espace probabilisé. Tout le reste du chapitre s'en déduit.
Conséquences immédiates des axiomes (théorème 1.1), avec l'inégalité de Boole . La formule d'addition se généralise à trois événements en (1.3). Noter que est démontré, non postulé.
Lois de De Morgan (1.1): le complémentaire de «au moins un» est «aucun». C'est le réflexe le plus rentable du chapitre — il résout le problème des anniversaires, le contrôle de réception et les dérangements.
Continuité monotone de la probabilité (théorème 1.3). C'est l'outil de tous les passages à la limite du cours: propriétés de la fonction de répartition (théorèmes 3.2 et 5.1), probabilité d'un point pour une variable continue.
Probabilité uniforme (1.4): sous équiprobabilité, calculer c'est compter. L'équiprobabilité est une hypothèse de modélisation, justifiée par une symétrie physique ou par un protocole de tirage, jamais une donnée de l'énoncé; sur un univers infini elle n'existe pas.
Les quatre modes de tirage de objets parmi (théorème 1.5, (1.6) et (1.7)): ordonné avec remise (-listes), ordonné sans remise (arrangements), non ordonné sans remise (combinaisons), non ordonné avec remise (étoiles et barres). Tous découlent du principe multiplicatif (1.5). L'ancienne notation française désigne et n'est pas employée dans le cours.
Symétrie, relation de Pascal, binôme de Newton et somme des coefficients (théorème 1.6). L'identité de Vandermonde s'y ajoute; elle sert à la loi hypergéométrique (4.15) et à la stabilité de la binomiale (théorème 7.13).
Formule du crible de Poincaré (théorème 1.7, (1.10)), valable pour des événements quelconques: on ajoute les simples, on retranche les doubles, on rajoute les triples. Appliquée au problème des chapeaux, elle donne la probabilité qu'aucune permutation n'ait de point fixe, qui converge vers dès à près (1.11).
Chapitre 2 – Conditionnement, Bayes et indépendance
Probabilité conditionnelle (2.1): on restreint l'univers à et l'on renormalise. L'application est elle-même une probabilité au sens de Kolmogorov (théorème 2.1), de sorte que tous les résultats du chapitre 1 s'y transportent sans nouvelle démonstration, à conditionnement fixé.
Formule des probabilités composées (théorème 2.2, (2.2)), sous l'hypothèse . C'est la règle de lecture d'un arbre pondéré: on multiplie le long d'un chemin, on additionne les feuilles qui réalisent un même événement, et la somme des branches issues d'un même nœud vaut .
Formule des probabilités totales (théorème 2.3, (2.3) et (2.4)) sur un système complet d'événements : deux à deux incompatibles, de réunion , chacun de probabilité strictement positive. C'est une moyenne pondérée, d'où l'encadrement gratuit .
Formule de Bayes (théorème 2.4, (2.5) et (2.6)). Vocabulaire: est la probabilité a priori, la vraisemblance, la probabilité et la constante de normalisation. La mise à jour est séquentielle: le posterior d'une observation sert de prior à la suivante.
Valeur prédictive positive d'un test de dépistage (2.9), en fonction de la prévalence , de la sensibilité et de la spécificité . Pour le Test D du cours (, , ): et , soit . , et : c'est l'erreur du procureur, que le chapitre 12 retrouvera à propos de la valeur .
Indépendance de deux événements (2.10) et ses caractérisations (théorème 2.5), les deux dernières exigeant , respectivement . Si , alors aussi , et . : deux événements incompatibles de probabilités strictement positives ne sont jamais indépendants, puisque .
Indépendance mutuelle de (2.11): égalités, et non les seules égalités deux à deux. Le contre-exemple de Bernstein (deux pièces; = premier pile, = second pile, = résultats égaux) donne trois événements indépendants deux à deux avec .
Indépendance conditionnelle (2.12) et fiabilité d'un montage en série (2.13) ou en parallèle (2.14), sous indépendance mutuelle des composants. Conditionner par une cause commune supprime la dépendance entre ses effets; conditionner par un effet commun en crée une entre ses causes (effet d'explication). En fiabilité, une alimentation partagée impose un plancher que nulle redondance ne franchit.
Chapitre 3 – Variables aléatoires discrètes
Loi d'une variable aléatoire discrète , fini ou dénombrable (théorème 3.1, (3.2) et (3.3)). Réciproquement, toute famille positive de somme est la loi d'une variable aléatoire: on peut donc définir une variable par sa loi, sans expliciter . Rappel: est une fonction, et est un événement; les forment une partition de .
Fonction de répartition (3.4), hauteur du saut (3.5) et probabilité d'un intervalle (3.6). est croissante, continue à droite, de limites et aux infinis (théorème 3.2); dans le cas discret son graphe est un escalier. Attention aux inégalités strictes: et diffèrent de .
Espérance (3.7). La convergence absolue est exigée parce que le support n'est pas ordonné par nature: une somme qui dépendrait de l'énumération ne serait pas une caractéristique de . Le jeu de Saint-Pétersbourg, , n'a pas d'espérance. Interprétations: centre de gravité de la loi, et moyenne à long terme (chapitre 8).
Théorème de transfert (théorème 3.3, (3.8)), valable dès que converge: on calcule sans déterminer la loi de . En général ; l'inégalité de Jensen donne pour convexe, l'inégalité étant renversée pour concave.
Linéarité de l'espérance (théorème 3.4, (3.9)) — sans aucune hypothèse d'indépendance — et espérance d'une indicatrice (3.11). Combinées, elles résolvent les comptages: écrire la quantité cherchée comme , puis , même si les sont fortement dépendants. Le problème des rencontres donne ainsi quel que soit (3.12).
Variance (3.13) et formule de König–Huygens (théorème 3.5, (3.14)), valable dès que existe — ce qui entraîne l'existence de . Une variance nulle caractérise les variables constantes. La forme développée est la plus économique à la main, mais elle soustrait deux grands nombres presque égaux: sur des données de grande magnitude, centrer d'abord (chapitre 9).
Effet d'une transformation affine (théorème 3.6, (3.15)) et variable centrée réduite (3.16). La translation disparaît, le facteur dilate; mesure «combien d'écarts-types au-dessus de la moyenne», sans dimension. C'est la standardisation du chapitre 6 et le moteur du chapitre 8.
Variance d'une indicatrice (3.17), maximale en où elle vaut ; moments et moments centrés, avec et le coefficient d'asymétrie . Une médiane est tout réel tel que et ; le maximise . Moyenne, médiane et mode répondent à trois questions distinctes: additionner, décrire un cas typique, désigner le cas le plus fréquent.
Chapitre 4 – Lois discrètes usuelles
Les trois lois centrales du chapitre: binomiale (théorème 4.3, (4.4)) pour le nombre de succès en épreuves indépendantes de même paramètre; géométrique (4.9), dans la convention du cours du nombre d'essais jusqu'au premier succès, de support ; Poisson (4.18) pour un comptage dans un continuum. C'est l'expérience décrite, jamais la forme d'une formule, qui désigne la loi.
Le tableau ci-dessous rassemble les sept lois discrètes du cours. Il a été recalculé terme à terme et sert de référence à tous les chapitres suivants.
| Loi | Expérience modélisée | Support | ||
|---|---|---|---|---|
| tirage équiprobable |
Pour la loi hypergéométrique, désigne la proportion de marqués dans la population, et le facteur est la correction de population finie. Références: (4.1) pour l'uniforme, (4.3) pour Bernoulli, (4.5) pour la binomiale, (4.11) pour la géométrique, (4.14) pour Pascal, (4.16) pour l'hypergéométrique, (4.20) pour Poisson. La loi de Bernoulli est le cas de la binomiale, la loi géométrique le cas de Pascal. L'égalité est la signature de la loi de Poisson: sur des comptages réels, une variance empirique très supérieure à la moyenne (surdispersion) réfute le modèle.
Loi hypergéométrique (4.15): tirage de objets sans remise dans une population de objets dont sont marqués. Son espérance est identique à celle de ; seule la variance change, du facteur de correction de population finie (4.17). Tirer sans remise est donc plus précis que tirer avec remise, et d'autant plus que l'on prélève une fraction importante de la population.
Mode de la loi binomiale (théorème 4.5, (4.7)); fonction de survie de la loi géométrique (4.10); absence de mémoire de la loi géométrique (théorème 4.8, (4.12)), dont elle est la seule loi sur à jouir. Un échec passé ne rapproche pas du succès futur: le compteur d'attente se remet à zéro, sans que l'espérance cesse de valoir.
Stabilité par somme de variables indépendantes (théorèmes 4.6 et 4.12, (4.8) et (4.21)). Pour la binomiale, le paramètre doit être commun: une somme de et avec n'est pas binomiale. La stabilité de Poisson permet de changer librement d'unité: un comptage sur une durée suit .
Théorème des événements rares (théorème 4.10, (4.19)) et inégalité de Le Cam (théorème 4.13, (4.22), admise). L'erreur de l'approximation de Poisson est gouvernée par , non par : à fixé, diviser par deux divise l'écart par deux. Les «conditions d'application» des manuels ( et , ou et ) sont des conventions de praticien, pas des théorèmes; on remplace par lorsque , avec la même réserve.
Chapitre 5 – Variables aléatoires continues
Définition d'une variable continue et conséquence centrale (théorème 5.2, (5.2)): tout point est de probabilité nulle, donc inégalités strictes et larges donnent le même résultat — l'inverse exact du cas discret. Probabilité nulle ne signifie pas impossible: seul l'ensemble vide l'est. Un événement de probabilité se produit presque sûrement.
Densité de probabilité (5.3), caractérisation (théorème 5.3, (5.5)) et probabilité comme aire (5.6). En tout point de continuité, (5.4). Une densité n'est pas une probabilité: elle peut dépasser et même ne pas être bornée; son unité est l'inverse de celle de , et l'interprétation locale est .
Espérance (5.7), théorème de transfert (théorème 5.4, (5.8)) et formule de König–Huygens (théorème 5.5, (5.10)). L'espérance n'existe que si converge. Les identités affines sont inchangées: et (5.11).
Loi de Cauchy standard (5.12) et (5.13): densité continue, paire, en cloche, sans espérance ni variance. La divergence est logarithmique, donc invisible en simulation. La moyenne de observations de Cauchy suit exactement la loi de Cauchy: moyenner n'apporte rien, la loi des grands nombres et le théorème central limite ne s'appliquent pas. Ses quantiles, eux, existent: médiane , quartiles .
Quantile d'ordre (5.14) et inverse généralisé (5.15), qui coïncide avec l'inverse usuel quand est continue et strictement croissante. Médiane , quartiles , , , écart interquartile. Contrairement à l'écart-type, ces indicateurs existent toujours et survivent aux lois à queues lourdes.
Densité d'une transformation monotone (théorème 5.6, (5.17)), le facteur étant le jacobien qui corrige la dilatation locale des longueurs; et cas non injectif (5.19), où il faut sommer sur tous les antécédents. La méthode universelle reste celle de la fonction de répartition: déterminer l'ensemble des valeurs de , traduire en un événement sur , exprimer par , dériver — puis , contrôle qui détecte l'oubli d'une branche.
Simulation par transformation inverse (théorème 5.7, (5.20)). C'est la manière dont un ordinateur tire une loi quelconque à partir d'un générateur uniforme; l'énoncé reste vrai avec l'inverse généralisé (5.15), ce qui couvre les lois discrètes et mixtes. Exemple: suit .
Loi tronquée (5.21) — on garde la densité au-dessus du seuil et l'on renormalise par la masse restante — et loi mixte, combinaison convexe d'une masse ponctuelle de poids et d'une loi à densité. Les lois mixtes apparaissent dès qu'un mécanisme produit une valeur privilégiée: sinistre annuel nul, jour sans pluie, attente nulle devant un guichet libre. Les traiter comme continues conduirait à écrire , ce qui est faux et important.
Chapitre 6 – Lois continues usuelles et loi normale
Le tableau suivant rassemble les six lois continues du cours. Toutes les espérances et variances y ont été recalculées par intégration.
| Loi | Densité (sur son support) | ||
|---|---|---|---|
| sur |
Références: (6.1) et (6.3) pour l'uniforme, (6.4) et (6.7) pour l'exponentielle, (6.10) pour la loi gamma, (6.11) pour Weibull, (6.12) et (6.15) pour la normale. Pour et , la loi de Weibull donne et , valeurs utilisées au chapitre 5. Le cas de la loi gamma et le cas de Weibull redonnent la loi exponentielle.
Fonction de survie de la loi exponentielle (6.6) et médiane. Le coefficient de variation vaut pour toute loi exponentielle, et la médiane est toujours inférieure à la moyenne: la loi est étalée vers la droite.
Absence de mémoire (théorème 6.3, (6.8)): la loi exponentielle est la seule loi continue sur à la posséder, ce qui en fait l'analogue continu de la loi géométrique. Elle affirme un taux de défaillance constant : hypothèse forte, raisonnable pour un composant électronique en vie utile ou un noyau radioactif, fausse pour tout ce qui s'use. La loi de Weibull, de taux , décrit la mortalité infantile (), le taux constant () et l'usure ().
Lien entre comptage de Poisson et temps d'attente exponentiel (théorème 6.4): et sont le même événement, d'où . Le paramètre est le même dans les deux lois, et le temps d'attente jusqu'à la -ième arrivée suit .
Densité et fonction de répartition de la loi normale centrée réduite (6.13), et intégrale de Gauss (6.14) qui fournit la constante de normalisation. La fonction n'a aucune primitive élémentaire: il n'existe donc pas de formule fermée pour , d'où les tables et la fonction d'erreur, . L'intégrale de Gauss se calcule en coordonnées polaires (Analyse II, chapitre 9, «Intégrales doubles»).
Standardisation (théorème 6.6, (6.16) et (6.17)) et dé-standardisation d'un quantile (6.20). Le score standardisé est sans dimension et mesure la distance à la moyenne en écarts-types. Symétries utiles: , et (théorème 6.7, (6.18)).
Règle des ––. Elle est propre à la loi normale, contrairement à l'inégalité de Tchebychev du chapitre 8 qui vaut pour toutes les lois. Attention: le nombre des intervalles de confiance à n'est pas mais , et l'aire exacte entre est , non .
Quantiles de la loi normale centrée réduite, indexés par leur ordre (6.19), et obtenus par bissection sur . Par symétrie , donc et . La convention concurrente indexe par l'aire de la queue droite et écrit : les nombres sont les mêmes, l'indice change.
Stabilité de la famille normale par transformation affine (théorème 6.8, (6.21)) et par combinaison linéaire de variables indépendantes (théorème 6.9, (6.23)); conséquence (6.24) pour la moyenne empirique d'un échantillon normal. L'écart-type de vaut : pour diviser l'incertitude par deux, il faut quadrupler l'échantillon.
Approximation normale de la binomiale, ou théorème de de Moivre–Laplace (théorème 6.10, (6.25)), avec la correction de continuité qui remplace chaque entier par le segment . Elle divise l'erreur par un facteur à dans les cas travaillés, et elle est indispensable pour approcher , qu'une loi continue évaluerait à zéro. Les conditions et sont une règle de pouce; quand est petit et modéré, c'est la loi de Poisson qu'il faut employer.
Chapitre 7 – Vecteurs aléatoires, covariance et corrélation
Loi conjointe (7.1), lois marginales par sommation (théorème 7.1, (7.3)) et loi conditionnelle (7.4). Sur un tableau de contingence, une marge est une somme de ligne ou de colonne, et une loi conditionnelle est une colonne divisée par sa propre marge. La loi conjointe détermine les marges, jamais l'inverse: l'information sur le lien est précisément ce qui se perd en passant aux marges.
Indépendance de deux variables aléatoires, dans le cas discret (7.5), dans le cas général (7.6) et dans le cas à densité (théorème 7.2, (7.10)). Lecture visuelle: sur un tableau, les colonnes sont toutes proportionnelles entre elles; dans le cas continu, le support est nécessairement un rectangle — un support triangulaire ou circulaire interdit l'indépendance sans le moindre calcul, mais un support rectangulaire ne la garantit pas.
Théorème de transfert pour un couple (théorème 7.3, (7.13) et (7.14), admis). Il donne la linéarité sans hypothèse d'indépendance (théorème 7.4, (7.15)), et indépendance (théorème 7.5, (7.16)).
Covariance (7.17), formule de Koenig (théorème 7.6, (7.18)) et identité fondatrice (7.19): la variance est la covariance d'une variable avec elle-même. La covariance est symétrique, bilinéaire, invariante par translation, nulle contre une constante (théorème 7.7) — c'est un produit scalaire sur les variables centrées de carré intégrable.
Variance d'une somme (théorème 7.8, (7.20) et (7.21)). En particulier (7.22) et (7.23). Attention: la variance d'une contient une somme de variances.
Additivité de la variance (théorème 7.9, (7.24)) et erreur type de la moyenne (7.25). L'hypothèse réellement utilisée est la non-corrélation, plus faible que l'indépendance. C'est le résultat que les chapitres 8 à 12 emploient à chaque page: la décroissance en de l'erreur d'échantillonnage n'a pas d'autre origine.
Coefficient de corrélation de Bravais–Pearson (7.26) et inégalité de Cauchy–Schwarz (théorème 7.10, (7.27)), démontrée par le discriminant du trinôme . Le cas d'égalité caractérise une relation affine exacte presque sûre, le signe de étant celui de . Le coefficient est sans unité et invariant par changement d'échelle affine croissant.
Hiérarchie à retenir. Contre-exemple minimal: uniforme sur et donnent alors que est une fonction de . Ce qui s'annule est la seule composante linéaire du lien. L'exception est le couple gaussien (7.37), pour lequel équivaut à l'indépendance (théorème 7.16, (7.38)) — mais il ne suffit pas que les deux marginales soient normales pour que le couple le soit.
Espérance conditionnelle (7.28) et formule de l'espérance totale, dite propriété de la tour (théorème 7.11, (7.29) et (7.30)). Distinguer soigneusement , un nombre fonction de , de , une variable aléatoire fonction de . La formule permet de calculer une espérance en deux temps, en conditionnant sur la première étape d'une expérience, ce qui est presque toujours plus court que d'établir la loi complète.
Produit de convolution (théorème 7.12, (7.31) et (7.32)), pour et indépendantes: on énumère toutes les façons d'écrire comme somme d'une valeur de chacune, et l'on additionne les produits de probabilités. Résultats de stabilité: (théorème 7.13), (théorème 7.14), (théorème 7.15, admis). En revanche la somme de deux uniformes est , et la somme de deux exponentielles suit .
Chapitre 8 – Théorèmes limites
Inégalités de Markov (théorème 8.1, (8.1)) et de Bienaymé–Tchebychev (théorème 8.2, (8.2) et (8.3)). Markov exige la positivité — pour une normale centrée elle serait fausse; Tchebychev s'en déduit en l'appliquant à . Elles sont universelles et très lâches: à deux écarts-types, la borne annonce contre en réalité pour une loi normale. On s'en sert pour démontrer, pas pour calculer. L'inégalité unilatérale de Cantelli, (8.16), est optimale dans la classe des lois de variance .
Convergence en probabilité (8.4). Elle autorise, à chaque rang, un petit ensemble d'issues où dérape, à condition que cet ensemble rétrécisse — et rien n'interdit qu'il se déplace d'un rang à l'autre. C'est exactement ce que la loi forte interdit.
Loi faible des grands nombres (théorème 8.3, (8.5)), qui découle de Tchebychev et de (8.6) pour des variables i.i.d. de variance finie; et loi forte de Kolmogorov (théorème 8.4, (8.7), admise), qui ne demande que l'existence de et affirme la convergence presque sûre. Sans espérance — loi de Cauchy — il n'y a aucune convergence. : l'écart absolu croît comme tandis que l'écart de fréquence décroît comme ; croire le contraire est l'erreur du joueur.
Méthode de Monte-Carlo (8.8): la loi des grands nombres lue à l'envers, pour calculer une quantité déterministe écrite comme une espérance. Son erreur décroît en — cent fois plus de tirages par décimale gagnée — mais cette vitesse ne dépend pas de la dimension, ce qui la rend imbattable au-delà de cinq ou six variables.
Théorème central limite de Lindeberg–Lévy (théorème 8.5, (8.10) et (8.11), admis), pour des variables i.i.d. d'espérance et de variance finie et non nulle. Les deux écritures sont la même relation, l'une pour la moyenne, l'autre pour la somme, d'où les approximations et (8.12). : additionner deux cents salaires ne rend pas les salaires normaux. Il approche des probabilités, il est d'autant moins fiable qu'on s'éloigne du centre, et la règle «» n'est pas un théorème.
Inégalité de Berry–Esseen (théorème 8.6, (8.13), admise): la vitesse générale est en , et le facteur mesure l'asymétrie de la loi de départ. Il vaut pour une Bernoulli symétrique, pour l'uniforme, pour l'exponentielle. En pratique, une loi de départ offre une décimale de plus, l'erreur y décroissant en et non en : l'approximation est excellente dès pour une uniforme et encore imparfaite à pour une exponentielle.
Théorème de de Moivre–Laplace (8.14) comme cas particulier du théorème central limite appliqué à une somme de variables de Bernoulli, et correction de continuité (8.15). Celle-ci s'applique à toute loi à valeurs entières approchée par une loi continue; son effet est d'ordre et elle ne coûte rien.
Chapitre 9 – Statistique descriptive et lois d'échantillonnage
Effectifs, fréquences (9.1), densité de fréquence d'une classe de largeur (9.2) et fonction de répartition empirique. Dans un histogramme, c'est l'aire des rectangles qui porte la fréquence, jamais leur hauteur: sur des classes inégales — tranches d'âge, tranches de revenu — porter l'effectif en ordonnée surévalue systématiquement les classes larges.
Moyenne arithmétique (9.3) et ses trois propriétés: somme nulle des écarts, linéarité , et minimisation de la somme des carrés. La moyenne utilise toute l'information numérique mais cède devant une seule valeur aberrante; la médiane, qui ne dépend que des rangs, a un point de rupture de .
Quantile empirique (9.4), convention retenue par ce cours et employée dans tous les chapitres. D'autres conventions, fondées sur une interpolation entre statistiques d'ordre, donnent des valeurs différant d'un ; les logiciels en implémentent au moins neuf. Ce qui n'est pas négociable est de dire laquelle on emploie.
Variance d'un échantillon (9.5), avec le diviseur employé partout dans ce cours, forme de König–Huygens (9.6) et coefficient de variation. La version «de population» n'est correcte que si la série toute la population. Le coefficient de variation n'a de sens que pour des grandeurs dont le zéro a une signification physique.
Construction de la boîte à moustaches et coefficient d'asymétrie (9.7). Les moustaches s'arrêtent à la dernière valeur observée à l'intérieur des barrières, et toute observation au-delà est portée individuellement. Le coefficient vient de Tukey: pour une population normale, environ des observations tombent au-delà des barrières. Un point signalé n'est pas une erreur de mesure, c'est une observation à examiner.
Modèle de l'échantillon aléatoire simple et distinction fondamentale marquée par la majuscule. «Même loi» signifie que la machine ne dérive pas pendant le prélèvement; «indépendance» s'obtient par la méthode de prélèvement, jamais par décret. Une statistique est une fonction de l'échantillon ne dépendant d'aucun paramètre inconnu; sa loi est sa loi d'échantillonnage.
Espérance et variance de la moyenne empirique (théorème 9.1, (9.8)). L'espérance ne demande rien; la variance demande seulement la non-corrélation. Ne pas confondre , dispersion des pièces, qui produit les rebuts et ne dépend pas de , avec , dispersion de la moyenne, qui limite la précision du contrôle.
Loi de la moyenne empirique (théorème 9.2, (9.9) et (9.10)). Dans le cas normal il n'y a aucune approximation et aucune condition sur ; dans le cas général, c'est le théorème central limite du chapitre 8, et «assez grand» dépend de l'asymétrie de la loi de départ.
La variance empirique corrigée est sans biais (théorème 9.3, (9.11)), sans aucune hypothèse de normalité. La démonstration repose sur l'identité , dont l'espérance du terme correctif vaut exactement , c'est-à-dire la contribution d'une observation: c'est le consommé pour estimer par .
Les trois lois dérivées de la normale, définies à partir de variables indépendantes: khi-deux (, , mode pour , asymétrique à droite), Student (9.13) (symétrique, pour , pour , queues plus épaisses que la normale) et (asymétrique à droite, , ). Leurs quantiles sont tabulés à l'annexe A.
Lois d'échantillonnage dans le cas normal (théorème 9.4, (9.12), admis, et théorème 9.5, (9.14)). L'indépendance de et est propre à la loi normale: elle traduit l'invariance par rotation d'un vecteur gaussien à composantes indépendantes de même variance, dont les projections sur deux sous-espaces orthogonaux sont alors indépendantes. Le théorème 9.5 est ce qui rend la statistique praticable: remplacer , jamais connu, par , au prix d'une loi à queues plus épaisses. Numériquement, contre : ignorer coûte ici de précision.
Chapitre 10 – Estimation ponctuelle
Biais (10.1), erreur quadratique moyenne (10.2) et décomposition biais-variance (théorème 10.1, (10.3)). Il y a exactement deux façons de se tromper en moyenne quadratique — viser à côté et trembler — et elles s'additionnent sans interférer. «Sans biais» exige pour toute valeur de . Ces propriétés sont celles de l'estimateur, c'est-à-dire de la procédure, jamais celles de l'estimation.
Condition suffisante de convergence (théorème 10.2, (10.6) et (10.7)): il suffit que le biais et la variance tendent vers zéro. C'est l'inégalité de Bienaymé–Tchebychev du chapitre 8 sous sa forme statistique; appliquée à , elle redonne littéralement la loi faible des grands nombres. Un estimateur biaisé à fini peut parfaitement être convergent.
Les deux estimateurs de référence (théorèmes 10.3 et 10.4, (10.8) à (10.11)). La version non corrigée , de pour et de pour ; elle est asymptotiquement sans biais et convergente. En revanche sans biais pour : par concavité de la racine et inégalité de Jensen, , avec , soit et .
Efficacité relative et borne de Cramér–Rao (théorème 10.5, (10.12), admise), où est l'information de Fisher d'une observation. Elle ne vaut que pour les estimateurs sans biais et sous des conditions de régularité: le support de la loi ne doit pas dépendre de . La moyenne empirique atteint la borne pour (), pour () et pour à connue (): aucun estimateur sans biais ne fait mieux.
Méthode des moments (10.13): on égale moments théoriques et moments empiriques, puis on résout en . Elle est simple et convergente, mais ni canonique — elle donne des réponses différentes selon les moments choisis — ni efficace, et elle peut produire des estimations incompatibles avec les données ( pour une peut être inférieur au maximum observé).
Vraisemblance et log-vraisemblance (10.14): les données sont fixées, c'est qui varie. On maximise le logarithme parce qu'il transforme le produit en somme, ne déplace pas le maximum et évite l'écrasement numérique. Méthode en quatre temps: écrire , dériver et annuler, vérifier la concavité, examiner les bords de — c'est la quatrième étape que l'on oublie.
| Modèle | Estimateur du maximum de vraisemblance | Propriétés |
|---|---|---|
| sans biais, variance , efficace |
Le modèle uniforme (10.16) est le contre-exemple à retenir: ne s'annule jamais, et le maximum est au bord du domaine. C'est aussi le modèle où les conditions de régularité de Cramér–Rao tombent, et où l'erreur quadratique moyenne décroît en et non en .
Invariance de l'estimateur du maximum de vraisemblance (théorème 10.6, (10.18)): pour estimer une fonction du paramètre, il suffit d'appliquer cette fonction à l'estimation, sans nouvelle maximisation. Cette propriété, que l'absence de biais ne possède pas, explique une bonne part du succès de la méthode. Le maximum de vraisemblance garantit la convergence, la normalité et l'efficacité asymptotiques; il ne garantit ni l'absence de biais à fini, ni l'existence d'une solution de l'équation de vraisemblance.
Chapitre 11 – Intervalles de confiance
Définition d'un intervalle de confiance de niveau (11.3). Les bornes et sont des statistiques, donc des variables aléatoires; est un nombre inconnu mais fixe. La condition «pour toute valeur de » est essentielle: sans elle, un intervalle constant satisferait la définition. La longueur mesure la précision, le niveau la fiabilité, et à échantillon fixé l'une se paie sur l'autre.
Méthode du pivot, la seule technique de construction du chapitre. Un pivot n'est pas une statistique: il contient . On l'encadre par deux quantiles ( pour une loi symétrique, dans chaque queue sinon), puis on résout la double inégalité en surveillant les changements de sens — multiplication par un nombre négatif, passage à l'inverse. Les quatre manipulations étant des équivalences, la probabilité est inchangée.
Le tableau ci-dessous rassemble tous les intervalles bilatéraux du cours, avec leur pivot, leur loi et leurs conditions d'emploi.
| Paramètre | Intervalle de confiance | Pivot et sa loi | Conditions |
|---|---|---|---|
| , connu |
Références: théorème 11.1 (11.7), théorème 11.2 (11.11), théorème 11.4 (11.15), théorème 11.5 (11.17), théorème 11.6 (11.24), avec la variance combinée (11.23). Pour des variances inégales, on passe à la construction de .
Le niveau qualifie la procédure, jamais l'intervalle observé. Une fois l'échantillon observé, les bornes sont des nombres, est un nombre, et l'inclusion est vraie ou fausse: sa probabilité vaut ou . Ce qui vaut est la fréquence de succès de la règle de calcul sur des échantillons répétés. Écrire que est donc une faute; donner une probabilité à lui-même relève de la démarche bayésienne et produit un intervalle de , qui est un autre objet.
Intervalles unilatéraux (11.19): tout le risque est placé d'un seul côté, donc le quantile est et non , et la borne est plus serrée. Le côté doit découler de la question posée et être fixé avant de voir les données; le choisir après coup double le risque réel.
Taille d'échantillon pour une demi-largeur visée , pour une moyenne (11.20) et pour une proportion (11.21) dans le pire cas , où est maximal. Arrondir au-dessus. La règle de poche (11.22) donne pour points, pour points et pour point: , et la taille de la population n'intervient pas.
Dualité avec les tests (11.25), reprise au théorème 12.3. Un intervalle répond simultanément à toutes les questions de test de cette forme, et il donne en outre l'ordre de grandeur des écarts compatibles avec les données, ce qu'un verdict binaire perd.
Chapitre 12 – Tests d'hypothèses
Risques de première et de deuxième espèce (12.1) et (12.2). Le risque est un nombre, que l'on fixe, parce que spécifie une seule loi; le risque est une fonction de l'écart réel, que l'on calcule, et parler de sans dire contre quel écart n'a pas de sens. Les deux aires ne sont pas sous la même courbe: additionner et n'a aucune signification. À fixé ils varient en sens contraire; seul un plus grand les améliore tous les deux.
Construction d'un test en cinq temps: poser et , fabriquer la statistique de test à partir d'un pivot du chapitre 11, choisir le seuil, délimiter la région de rejet, et seulement ensuite regarder les données. On dit «rejeter» ou «ne pas rejeter», jamais «accepter»: un non-rejet est un constat d'insuffisance de preuve, compatible aussi bien avec une exacte qu'avec un échantillon trop petit.
Valeur (12.7) et équivalence des deux règles de décision (12.8). La valeur est le plus petit seuil auquel les données conduiraient au rejet. Trois choses qu'elle n'est pas: la probabilité que soit vraie — c'est et non , exactement le dépistage du chapitre 2 —; une preuve que est vraie quand elle est grande; une mesure de la taille de l'effet, puisqu'elle dépend autant de que de l'écart.
Le tableau ci-dessous rassemble tous les tests du cours.
| Test | Statistique | Loi sous | Conditions |
|---|---|---|---|
| Moyenne, connu |
Références: théorème 12.1 (12.6) pour le test de Student, (12.9) pour le test , (12.11) pour la proportion, (12.12) pour deux moyennes, (12.13) pour Welch, (12.14) pour la variance, théorème 12.2 (12.15) pour l'ajustement, (12.16) et (12.17) pour l'indépendance. La règle de Cochran demande que tous les effectifs attendus soient au moins égaux à et qu'au plus d'entre eux soient inférieurs à .
Régions de rejet bilatérale et unilatérale. Le test unilatéral place tout son risque du même côté: sa valeur critique est plus basse et il rejette plus facilement, dans la direction prévue seulement. Lorsque l'écart observé va dans le sens de l'alternative, . Choisir le côté après avoir vu les données porte le risque réel de à : .
Puissance d'un test bilatéral sur une moyenne à connu (12.18) et dimensionnement de l'échantillon (12.19). Tout dépend de l'écart réduit : doubler ou quadrupler ont le même effet. Pour et une puissance de , la somme des deux quantiles vaut . La dépendance en est brutale: détecter un écart deux fois plus petit coûte quatre fois plus d'observations. ; la «puissance observée», calculée a posteriori, est une fonction décroissante de la valeur et n'apporte rien.
Dualité entre tests bilatéraux et intervalles de confiance (théorème 12.3, (12.20)). Elle vaut entre un test bilatéral et un intervalle bilatéral, et entre un test unilatéral et un intervalle unilatéral; les croiser est une confusion classique. Conséquence pratique: publier l'estimation, son intervalle de confiance et la valeur exacte, jamais le seul mot «significatif».
Problème des tests multiples (12.21). Vingt tests indépendants au seuil de sur des hypothèses toutes vraies produisent au moins une fausse alarme avec probabilité ; cent tests, avec probabilité . Bonferroni ramène le risque global sous au prix d'une perte de puissance. L'essentiel est ailleurs: il faut déclarer combien de tests ont été faits, car les tentatives implicites — variables de résultat multiples, sous-groupes, règle d'arrêt adaptative, retrait de valeurs aberrantes après coup — sont rarement visibles. Le remède est procédural: pré-enregistrer le protocole et séparer ce qui était prévu de ce qui a été exploré.
Coefficient de Cramér, mesure d'intensité comprise entre et pour un tableau de contingence. Il répond à «de quelle ampleur?» quand la valeur répond à «peut-on exclure le hasard?». Un croît avec à structure inchangée; un , non. Significatif et important sont deux questions distinctes, et la seconde demande une taille d'effet, une unité et un jugement de métier.
Repères numériques du cours
Ces valeurs, recalculées par bissection sur les fonctions de répartition, sont celles que les chapitres 6 à 12 emploient sans les redémontrer.
| Quantile | Valeur | Emploi principal |
|---|---|---|
| fractile à | ||
Le fil rouge de l'atelier fictif «Jura Précision» donne, pour l'échantillon A ( axes, diamètre nominal mm, tolérance ): mm, mm, mm², quartiles · · , pièces hors tolérance donc , intervalle de confiance à pour égal à et test bilatéral de donnant avec une valeur de — . Pour l'échantillon B (): mm, mm, quartiles · · . La comparaison des deux machines donne , à degrés de liberté et une valeur de : . Enfin, le sondage de personnes avec donne l'intervalle , de demi-largeur points de pourcentage — la «marge d'erreur de trois points» de la presse, qui ne couvre que l'aléa d'échantillonnage et rien des biais de non-réponse.