Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
- reconnaître une variable aléatoire discrète comme une fonction définie sur l'univers, lire la notation comme un événement, et déterminer la loi de à partir de l'univers ;
- construire le diagramme en bâtons d'une loi, sa fonction de répartition en escalier, et lire sur celle-ci une probabilité du type ;
Une variable aléatoire est une fonction
Du résultat brut au nombre qui intéresse
Les chapitres 1 et 2 ont construit l'objet de base de la théorie: un espace probabilisé , où est l'ensemble des résultats possibles d'une expérience aléatoire, la famille des événements et la probabilité. Cet objet est complet, mais il est rarement celui que l'on manipule.
Prenez un lancer de deux dés. L'univers naturel est , qui compte couples équiprobables. Or personne ne s'intéresse au couple en tant que tel: on s'intéresse à la somme , ou au maximum , ou au fait que les deux dés soient égaux. De même, un assureur n'observe pas le détail de ce qui est arrivé à chacun de ses assurés pendant l'année: il observe le montant total qu'il doit verser. Un ingénieur qualité n'inventorie pas les micro-causes de chaque défaut: il compte les pièces non conformes dans un lot.
Dans chacun de ces cas, on a résumé le résultat brut par un nombre. Ce résumé est une fonction de vers , et c'est exactement ce qu'on appelle une variable aléatoire.
Trois remarques sur cette définition, dans l'ordre d'importance décroissante.
Une variable aléatoire n'est ni une variable ni aléatoire. Ce nom, hérité du XIXe siècle, est doublement trompeur. est une fonction, parfaitement déterminée: si l'on connaît , on connaît sans la moindre incertitude. Ce qui est aléatoire, c'est le tirage de , pas l'application . Écrire «» ne signifie donc pas que vaut : cela désigne l'ensemble des pour lesquels la fonction prend la valeur . Si vous ne retenez qu'une chose de cette section, retenez celle-là: . La confusion entre la fonction et ses valeurs est la première source d'erreurs du chapitre, et c'est la raison pour laquelle on réserve les majuscules aux variables aléatoires et les minuscules à leurs valeurs — une convention que ce cours suit sans exception.
La condition technique est indispensable pour pouvoir parler de probabilité. Il faut bien que soit un événement, faute de quoi n'aurait aucun sens. Lorsque est fini ou dénombrable et , comme c'est presque toujours le cas dans ce chapitre, la condition est automatiquement vérifiée et on peut l'oublier. Elle redevient une vraie contrainte pour les variables continues du chapitre 5.
Le mot «discrète» porte sur l'ensemble des valeurs, pas sur l'univers. On peut très bien définir une variable discrète sur un univers non dénombrable: si l'on tire un point au hasard dans un carré et que vaut lorsque le point tombe dans le disque inscrit et sinon, est un carré du plan mais ne prend que deux valeurs. C'est bien une variable aléatoire discrète.
L'événement
La notation la plus utile du chapitre est aussi la plus elliptique. On écrit
et de même pour , , . Ce sont des événements: des parties de . On peut donc leur appliquer tout le vocabulaire des chapitres 1 et 2 — union, intersection, complémentaire, probabilité conditionnelle, indépendance.
Deux conséquences immédiates, qu'on utilisera partout:
- les événements , pour parcourant le support, sont deux à deux disjoints (une fonction ne prend qu'une valeur en chaque point) et leur réunion est tout entier: ils forment une partition de . C'est exactement le système complet d'événements du chapitre 2, celui qui fait marcher la formule des probabilités totales;
- par conséquent, la -additivité donne , la somme portant sur le support, fini ou dénombrable.
Enfin, on écrit couramment au lieu de : les accolades tombent, et c'est sans danger tant qu'on se souvient qu'elles sont là.
Le changement de point de vue
Voici le mouvement décisif du chapitre, et il mérite d'être dit lentement. Jusqu'ici, un problème de probabilité se traitait sur : on décrivait l'univers, on comptait ses éléments, on formait des événements. Désormais, une fois introduite, on abandonne et on travaille sur les valeurs de .
Pourquoi est-ce légitime? Parce que toute question portant sur seule — , , la valeur moyenne de , la dispersion de — se lit sur la seule donnée des nombres . L'univers de départ disparaît alors du calcul. C'est une économie considérable: on remplace un univers de couples par une liste de probabilités, ou un univers de configurations par une liste de nombres.
Pourquoi est-ce dangereux? Parce que, dès que deux variables aléatoires interviennent ensemble, la seule connaissance des lois de et de ne suffit plus: il faut savoir comment elles sont couplées sur . Deux variables peuvent avoir chacune la loi d'un dé équilibré et être soit indépendantes, soit égales, soit opposées. C'est tout l'objet du chapitre 7 sur les vecteurs aléatoires. Retenez donc: résumer par la loi de est gratuit tant qu'on ne regarde que .
Soit une variable aléatoire discrète sur un univers . Laquelle de ces affirmations est correcte?
La loi d'une variable aléatoire discrète
Définition et caractérisation
Le nombre de faces d'une pièce lancée trois fois et le nombre de filles dans une fratrie de trois enfants (sous l'hypothèse, discutable, de naissances indépendantes et équiprobables) ont la même loi, bien que leurs univers n'aient rien à voir. Toutes les questions portant sur une seule de ces variables reçoivent donc la même réponse. C'est ce qui permettra, au chapitre 4, de tabuler une fois pour toutes quelques lois de référence et de les réutiliser partout.
Démonstration. La positivité est celle de . Les événements , , sont deux à deux disjoints et de réunion , donc la -additivité (axiome de Kolmogorov, chapitre 1) donne ; la série étant à termes positifs, sa somme ne dépend pas de l'ordre des termes, ce qui autorise la notation sans préciser d'énumération. Le même argument appliqué à donne (3.3).
Pour la réciproque, on construit un espace probabilisé témoin: prenons , , et . Les axiomes sont vérifiés grâce à , et .
La réciproque est plus qu'une curiosité: elle autorise à définir une variable aléatoire par sa loi, sans jamais expliciter . C'est ce qu'on fera systématiquement à partir du chapitre 4, en écrivant par exemple «soit » sans dire un mot de l'univers sous-jacent.
Le diagramme en bâtons
On représente une loi discrète par son diagramme en bâtons: en chaque point du support, un segment vertical de hauteur . Ce n'est pas un histogramme — un histogramme, réservé aux données groupées en classes (chapitre 9), code la probabilité par une aire; ici la hauteur porte toute l'information, et l'axe des abscisses n'a pas de largeur de classe.
Pour la loi de l'exemple 3.2, calculez .
La fonction de répartition
Définition et lecture
Pour une variable discrète, s'obtient en cumulant les bâtons situés à gauche de :
Entre deux valeurs consécutives du support, aucun bâton ne s'ajoute: est constante. En chaque valeur du support, elle fait un saut dont la hauteur vaut exactement . Le graphe est donc un escalier, dont les marches sont horizontales et dont les contremarches sont les probabilités élémentaires.
Sur la figure 3.1, deux détails graphiques disent tout le contenu mathématique. Le cercle plein en haut de chaque saut indique que la valeur est atteinte en : , et non . Le cercle vide en bas indique que la valeur inférieure n'est pas atteinte en : elle ne vaut que pour strictement inférieur à . C'est la traduction visuelle de la continuité à droite énoncée ci-dessous.
Démonstration. (1) Si , alors et la croissance de (chapitre 1) donne .
(5) Les événements et sont disjoints et leur réunion est ; l'additivité donne , d'où (3.6).
(2), (3) et (4) reposent sur la même propriété, la continuité monotone de démontrée au chapitre 1: si est une suite croissante d'événements, , et l'énoncé analogue pour une suite décroissante. Pour (2), prenons : la suite croît vers , donc ; comme est croissante, la limite en vaut . De même décroît vers , d'où la limite . Pour (3), prenons : la suite décroît vers (un réel qui est pour tout est ), donc : est continue à droite. Pour (4), croît vers , donc , et donne (3.5).
Ces propriétés ne sont pas propres au cas discret: elles valent pour toute variable aléatoire, et le chapitre 5 les réutilisera telles quelles pour les variables continues. Ce qui distingue le cas discret, c'est que y est constante par morceaux: toute la probabilité est concentrée dans les sauts. Une variable continue aura au contraire une continue, donc sans saut, donc avec pour tout — ce qui, au vu de (3.5), n'a rien de paradoxal.
On démontre (et nous l'admettons ici, car la preuve complète relève de la théorie de la mesure, qui n'est pas au programme) que ces propriétés caractérisent les fonctions de répartition: toute fonction croissante, continue à droite, de limites et aux infinis, est la fonction de répartition d'une variable aléatoire et d'une seule loi.
La fonction de répartition d'une variable discrète vaut et . Que vaut ?
L'espérance
Définition
L'espérance est la moyenne des valeurs de , chaque valeur étant pesée par sa probabilité.
Pourquoi exiger la convergence absolue et non la simple convergence? Parce qu'une série semi-convergente a une somme qui dépend de l'ordre des termes (théorème de réarrangement de Riemann, Analyse I, chapitre sur les séries), alors que le support de n'est pas ordonné par la nature: c'est nous qui choisissons de l'énumérer dans un sens ou dans un autre. Une espérance qui changerait selon la manière dont on numérote les valeurs ne serait pas une caractéristique de . La convergence absolue rend la somme indépendante de l'énumération, et c'est exactement ce qu'il faut.
L'espérance comme centre de gravité
Imaginez la droite réelle comme une tige rigide sans masse, et déposez en chaque point du support une masse ponctuelle . La masse totale vaut , et le centre de gravité du système, par définition de la mécanique, est le point tel que . En développant, : le centre de gravité l'espérance.
Ce n'est pas une analogie décorative, c'est une identité, et elle rend plusieurs propriétés évidentes. L'espérance est toujours comprise entre le minimum et le maximum du support (une balance ne s'équilibre pas hors de la tige). Elle n'appartient pas nécessairement au support: un dé a pour espérance , qui n'est pas une face possible. Et elle est très sensible aux valeurs éloignées, puisqu'un bras de levier long compense une petite masse — ce qui sera le ressort du contre-exemple de la section sur la variance.
L'espérance comme moyenne à long terme
La deuxième interprétation est statistique, et c'est elle qui justifie l'emploi du mot «moyenne». Si l'on répète l'expérience fois de façon indépendante et que l'on note les valeurs observées, la moyenne arithmétique se rapproche de quand grandit. C'est la , énoncée et démontrée au chapitre 8; nous nous contentons ici de l'annoncer, car sa démonstration demande l'inégalité de Bienaymé–Tchebychev, donc la variance.
Il faut cependant être précis sur ce que cette loi dit et ne dit pas. Elle porte sur la moyenne des observations, pas sur leur somme, et encore moins sur une observation individuelle. Croire qu'après une série de faces la pièce «doit» rattraper son retard est l'erreur du joueur: la pièce n'a pas de mémoire, et c'est le diviseur , non un mécanisme correcteur, qui fait converger .
Calculez l'espérance de la loi fictive de défauts de l'exemple 3.2, dont les probabilités sont ; ; ; ; pour .
Le théorème de transfert
Énoncé et démonstration
Si est une variable aléatoire et une fonction, alors , c'est-à-dire l'application , est encore une variable aléatoire discrète. Pour calculer , on pourrait déterminer la loi de puis appliquer (3.7). Le théorème suivant montre que ce détour est inutile.
Démonstration. Notons le support de , ensemble fini ou dénombrable. Pour , l'événement est la réunion disjointe des pour , donc
En reportant dans la définition de l'espérance de et en utilisant que les ensembles , , forment une partition de :
où l'on a remplacé par dans la somme intérieure, ce qui est licite puisque y est vrai par construction. Le regroupement des termes d'une famille dénombrable en paquets est légitime dès que la famille est sommable, c'est-à-dire absolument convergente — d'où l'hypothèse, qui sert donc deux fois: elle garantit l'existence de et elle autorise le réarrangement. Dans le cas d'un support fini, il s'agit d'un simple regroupement de termes d'une somme finie et aucune précaution n'est nécessaire.
Le nom de «transfert» dit bien ce qu'il fait: il transfère le calcul de l'univers des valeurs de vers celui des valeurs de . En pratique, on n'écrit presque jamais la loi de .
Linéarité de l'espérance et variables indicatrices
Le théorème le plus utile du cours
Démonstration. La première identité est un transfert avec :
la dernière somme valant par (3.2).
Pour la seconde, revenons à l'univers. Supposons d'abord fini ou dénombrable, avec . Pour toute variable discrète , en découpant chaque événement en singletons,
le réarrangement étant licite par sommabilité. La formule (3.10) exprime l'espérance comme une somme sur , où l'additivité est immédiate:
Dans le cas général, on procède de même en regroupant selon le couple : en notant la loi conjointe (chapitre 7), on a et , d'où
C'est ici qu'on voit pourquoi l'indépendance ne sert à rien: on n'a utilisé que les marges de la loi conjointe, jamais sa structure interne.
Variables indicatrices
Sa loi est immédiate: et . Par conséquent
Cette identité d'apparence anodine est un pont: elle transforme une probabilité en espérance, donc rend la linéarité applicable à des problèmes de comptage. Notez encore que , puisque et ; on en tirera la variance d'une indicatrice plus bas.
La recette, qu'il faut savoir dérouler mécaniquement:
- la quantité à moyenner est un nombre d'occurrences: = «nombre de tels que la propriété est vraie»;
- on écrit où ;
On lance un dé équilibré fois de suite. Soit le nombre d'indices tels que le lancer donne le même résultat que le lancer . Calculez .
Variance et écart-type
Mesurer la dispersion
L'espérance localise la loi; elle ne dit rien de son étalement. Les deux lois de la figure 3.3 ont la même espérance et n'ont pourtant pas grand-chose en commun. Pour quantifier l'étalement, on mesure l'écart typique à la moyenne. L'écart brut ne convient pas, puisque son espérance est nulle par linéarité — les écarts positifs et négatifs se compensent exactement, c'est même la définition du centre de gravité. On élève donc au carré.
La variance est une espérance — celle de la variable — et le théorème de transfert donne directement la somme de droite, avec . Elle est nulle si et seulement si tous les termes le sont, c'est-à-dire si presque sûrement: une variance nulle caractérise les variables .
Démonstration. Posons . En développant le carré et en utilisant la linéarité (théorème 3.4), qui s'applique terme à terme puisque chaque espérance existe:
Le fait que existe entraîne l'existence de : en effet pour tout réel , donc .
Une conséquence gratuite de (3.14) et de : on retrouve , c'est-à-dire l'inégalité de Jensen pour . Réciproquement, l'égalité n'a lieu que si est constante.
En pratique, (3.14) est presque toujours la bonne voie de calcul: elle évite de soustraire de chaque valeur. Une seule réserve, qui devient sérieuse au chapitre 9: si et sont deux grands nombres presque égaux, leur différence subit une annulation catastrophique en arithmétique flottante. Sur un échantillon de diamètres proches de mm, la formule développée peut renvoyer une variance négative. Quand les valeurs sont grandes et l'écart-type petit, centrez d'abord.
Démonstration. Soit . Par linéarité, , donc et
en sortant la constante par linéarité. L'écart-type s'obtient en prenant la racine, d'où la valeur absolue.
Les deux constantes jouent des rôles opposés, et c'est tout l'intérêt de la formule. La translation déplace la loi sans la déformer: elle ne change pas la dispersion, donc disparaît. Le facteur dilate la loi: il multiplie l'écart-type par et la variance par . Changer une température de degrés Celsius en degrés Fahrenheit () multiplie l'écart-type par ; passer des millimètres aux mètres le divise par et divise la variance par un million.
La variable centrée réduite
L'opération est une pure mise à l'échelle: on déplace l'origine au centre de gravité et on prend l'écart-type comme unité. Elle rend comparables des grandeurs hétérogènes — un diamètre en millimètres et une durée en secondes deviennent deux nombres sans dimension mesurant «combien d'écarts-types au-dessus de la moyenne». Cette normalisation est au cœur de la loi normale centrée réduite du chapitre 6, du théorème central limite du chapitre 8 et de toutes les statistiques de test du chapitre 12. Retenez la lecture: signifie «deux écarts-types au-dessus de la moyenne», quelle que soit l'unité de départ.
Une variable vérifie et . Que valent l'espérance et l'écart-type de ?
Moments
On généralise les deux quantités précédentes.
Ainsi , et . Si existe, tous les moments d'ordre inférieur existent aussi, par le même argument de domination que dans la démonstration du théorème 3.5. Le moment centré d'ordre , normalisé en , mesure l': il est nul pour une loi symétrique, positif lorsque la queue de droite est la plus longue — ce qui est le cas de la loi de la figure 3.2, où la moyenne dépasse la médiane. Le moment d'ordre , normalisé en , mesure l'aplatissement. Ces deux indicateurs sont d'usage descriptif; nous ne les emploierons pas systématiquement, et nous nous garderons d'en tirer des conclusions sur des échantillons de petite taille, où ils sont très instables.
Une variable discrète à valeurs dans possède un outil de calcul supplémentaire, que nous mentionnons sans le développer: la fonction génératrice , série entière de rayon de convergence au moins (Analyse I). Elle détermine la loi — ses coefficients de Taylor sont les — et ses dérivées en redonnent les moments: et , d'où . Elle transforme en outre la somme de variables indépendantes en produit de fonctions génératrices, ce qui en fait l'outil le plus économique pour les lois du chapitre 4.
Médiane et mode
L'espérance n'est pas le seul résumé possible d'une loi, ni toujours le plus pertinent.
Deux remarques sur la médiane. D'abord, elle n'est pas toujours unique: si vaut exactement sur tout un palier, chaque point de ce palier est une médiane, et l'usage est alors de prendre le milieu de l'intervalle. Dans l'exemple 3.3, et la valeur suivante du support est : toute valeur de est médiane, et l'on retiendra par convention. Ensuite, la convention de calcul la plus simple, quand il n'y a pas de palier à , consiste à prendre la plus petite valeur du support telle que .
Le mode n'est pas unique non plus: une loi peut être bimodale, et une loi uniforme est «toute entière» un mode, ce qui prive l'indicateur de sens.
Que choisir? Les trois résumés répondent à trois questions différentes.
- La moyenne est la bonne réponse quand on additionne: un total, un coût cumulé, un chiffre d'affaires. C'est la seule des trois qui soit linéaire, et c'est pour cela qu'elle domine toute la théorie. En revanche elle est sensible aux valeurs extrêmes, puisque chaque valeur agit par son bras de levier.
- La médiane est la bonne réponse quand on veut un individu typique et que la loi est fortement asymétrique: revenus, durées de réparation, tailles de fichiers. Elle est robuste — déplacer la plus grande valeur du support à l'infini ne la bouge pas — et elle minimise l'écart absolu moyen , alors que la moyenne minimise l'écart quadratique .
- Le mode est la bonne réponse quand on demande le cas le plus fréquent: la panne la plus courante, le nombre de clients le plus souvent observé à une caisse. C'est le seul des trois qui garde un sens pour une variable qualitative.
Remettez dans l'ordre les étapes du calcul de l'écart-type d'une variable aléatoire discrète dont on connaît la loi.
Glissez les éléments pour les mettre dans le bon ordre
- Appliquer König–Huygens:
- Dresser le tableau des valeurs et des probabilités , et vérifier que leur somme vaut 1
- Prendre la racine carrée pour obtenir , exprimé dans l'unité de
- Calculer par le théorème de transfert
- Calculer
Un laboratoire de lois discrètes
L'explorateur ci-dessous fixe cinq valeurs — , , , et — et vous laisse régler leurs poids. Les poids sont renormalisés à chaque mouvement, de sorte que la somme des probabilités vaut toujours : c'est la contrainte (3.2) rendue mécanique. Si vous ramenez tous les curseurs à zéro, il n'y a plus de loi du tout, et l'explorateur le dit au lieu d'afficher un résultat sans signification.
Deux expériences à faire dans l'ordre, en partant des poids par défaut , qui donnent et :
- Augmentez d'une unité le poids de la valeur . L'espérance monte un peu, l'écart-type bouge à peine.
- Revenez en arrière, puis augmentez d'une unité le poids de la valeur . L'espérance monte davantage — mais surtout, l'écart-type fait un bond sans commune mesure.
La raison est dans les exposants. L'espérance pèse les valeurs au premier degré, la variance les écarts au carré: une masse placée à distance du centre contribue proportionnellement à dans l'une et à dans l'autre. Déplacer de la probabilité vers une valeur lointaine est donc une opération à effet modéré sur la moyenne et à effet violent sur la dispersion. Cette asymétrie explique pourquoi la variance est si sensible aux valeurs aberrantes, pourquoi la médiane lui résiste, et pourquoi un assureur se préoccupe davantage de ses sinistres rares et énormes que de la moyenne de son portefeuille.
Observez aussi un invariant: quelle que soit la position des curseurs, la somme des cinq probabilités affichées vaut . C'est la seule contrainte que porte la définition d'une loi discrète, et elle suffit à tout le reste.
Les valeurs 0, 1, 2, 3 et 10 sont fixées; les curseurs règlent leurs poids, qui sont renormalisés pour que la somme des probabilités vaille toujours 1. Comparez ce qui arrive quand vous augmentez le poids de 3 et quand vous augmentez celui de 10: l'espérance bouge dans les deux cas, l'écart-type beaucoup plus dans le second, parce que la variance pèse les écarts au carré.
Deux applications complètes
Un contrat d'assurance
Un jeu équitable, et pourquoi cela ne suffit pas
Ce que le chapitre 4 ajoutera
Toute la théorie de ce chapitre vaut pour n'importe quelle loi discrète. Le chapitre 4 se concentrera sur cinq familles qui reviennent sans cesse — Bernoulli, binomiale, géométrique, hypergéométrique et Poisson —, en donnera l'espérance et la variance sous forme fermée, et dira quel mécanisme concret produit chacune. Deux d'entre elles sont déjà apparues ici sans être nommées: l'indicatrice de l'exemple 3.8 est une variable de Bernoulli, et la loi du nombre de piles en trois lancers est une loi binomiale.
Synthèse
- Une variable aléatoire discrète est une fonction à valeurs dans un ensemble dénombrable; est un événement, et les forment une partition de . Sa loi est la famille , caractérisée par et . Une fois la loi connue, on peut oublier — tant qu'on ne regarde qu'une variable à la fois.
Parmi ces familles de nombres indexées par , laquelle est la loi d'une variable aléatoire?
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
On lance trois fois une pièce équilibrée et l'on note le nombre de «pile» obtenus.
- Décrire l'univers et en déduire la loi de .
- Donner la fonction de répartition et calculer .
Une variable aléatoire a pour fonction de répartition
- On distribue au hasard cadeaux à personnes, une chacune. Montrer que le nombre moyen de personnes recevant le cadeau qui leur était destiné vaut , quel que soit .
- On lance fois un dé équilibré. Calculer l'espérance du nombre de «six» obtenus.
- Dans une classe de étudiants, on forme au hasard binômes. Un étudiant donné, Léa, a un ami, Marc, dans la classe. Calculer la probabilité que Léa et Marc soient ensemble, puis l'espérance du nombre de binômes formés de deux personnes qui sont amies, en supposant qu'il y a exactement paires d'amis dans la classe (donnée fictive).
Un investisseur compare deux placements sur un an, portant sur CHF 1000. Les données sont fictives.
- Placement A: gain de avec probabilité , de avec probabilité , de avec probabilité .
- Placement B: gain de ou de , avec probabilité chacun.
- Soit une variable aléatoire à valeurs dans admettant une espérance. Démontrer la formule de la queue:
Références
- Ross, S., Initiation aux probabilités, Presses polytechniques et universitaires romandes — chapitres sur les variables aléatoires discrètes, l'espérance et la variance; nombreux exercices d'application.
- Saporta, G., Probabilités, analyse des données et statistique, Technip — présentation unifiée des variables discrètes et continues par la fonction de répartition.
- Morgenthaler, S., Introduction à la statistique, Presses polytechniques et universitaires romandes — perspective statistique sur les résumés d'une loi (moyenne, médiane, mode).
- Dodge, Y., Statistique — dictionnaire encyclopédique, Springer — entrées «espérance mathématique», «variance», «médiane», utiles pour les conventions et l'histoire des notions.
- Wackerly, D., Mendenhall, W. & Scheaffer, R., Mathematical Statistics with Applications, Cengage — traitement détaillé du théorème de transfert et des moments.
- Rice, J., Mathematical Statistics and Data Analysis, Duxbury — fonctions génératrices et lois à queue lourde.