Probabilité conditionnelle, indépendance et formule de Bayes
Probabilité conditionnelle, formule des probabilités composées et totales, formule de Bayes, indépendance et arbres de décision.
Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
définir la probabilité conditionnelle P(A∣B), l'interpréter comme une restriction de l'univers à B, et démontrer qu'elle est elle-même une probabilité au sens des axiomes de Kolmogorov;
décomposer une expérience séquentielle par la formule des probabilités composées et conduire le calcul sur un arbre pondéré;
reconnaître un système complet d'événements et appliquer la formule des probabilités totales, puis la formule de Bayes, en nommant correctement les probabilités a priori, les vraisemblances et les probabilités a posteriori;
calculer la valeur prédictive d'un test de dépistage et expliquer pourquoi, sur une maladie rare, la majorité des tests positifs sont des faux positifs;
distinguer l'indépendance de l'incompatibilité, distinguer l'indépendance mutuelle de l'indépendance deux à deux, et construire un contre-exemple;
modéliser et calculer la fiabilité d'un système en série et en parallèle, un contrôle industriel à deux étages, et résoudre le problème de Monty Hall en explicitant les hypothèses de modélisation.
Conditionner, c'est restreindre l'univers
Une information partielle change les probabilités
Le chapitre 1 a construit un espace probabilisé (Ω,A,P) et posé les axiomes de Kolmogorov. Toutes les probabilités y étaient calculées «à froid», avant toute observation. Or, dans la pratique, on dispose presque toujours d'une information partielle: le médecin connaît le résultat d'un test, l'ingénieur sait que la machine s'est arrêtée, l'assureur sait que le conducteur a moins de 25 ans. Cette information ne change pas le hasard; elle change ce que nous savons de lui, donc les probabilités que nous devons lui attribuer.
Prenons l'exemple le plus dépouillé. On lance deux dés équilibrés discernables; l'univers Ω={1,…,6}2 compte 36 issues équiprobables (chapitre 1). L'événement A={la somme vaut 8} contient les cinq issues (2,6), (3,5), (4,4), (5,3), (6,2), donc P(A)=5/36≈0,139. Supposons maintenant que l'on nous annonce le résultat du premier dé: c'est un 3. Les issues encore possibles ne sont plus que six, (3,1) à (3,6), et une seule d'entre elles réalise A. La probabilité de Acompte tenu de cette information vaut donc 1/6≈0,167.
Ce calcul contient tout le mécanisme. On a remplacé l'univers Ω par le sous-ensemble B={le premier deˊ donne 3}, et l'on a compté, à l'intérieur de B, la proportion d'issues favorables à A. En termes de probabilités:
issues de Bissues de A∩B=P(B)P(A∩B)=6/361/36=61.
Le rapport final ne fait plus intervenir le dénombrement: il a un sens dans tout espace probabilisé, équiprobable ou non. C'est la définition.
Trois remarques s'imposent immédiatement.
La barre n'est pas un symbole d'ensemble.P(A∣B) ne se lit pas «la probabilité de l'événement A∣B»: il n'existe aucun événement A∣B dans A. La barre est une notation pour un nouveau nombre construit à partir de deux événements, et l'ordre des deux arguments est essentiel — c'est tout l'objet de la formule de Bayes, plus bas.
Le dénominateur renormalise. En divisant par P(B), on redonne à B la masse totale 1: P(B∣B)=P(B)/P(B)=1. C'est exactement l'opération «on se place à l'intérieur de B».
La condition P(B)>0 n'est pas un détail technique. Conditionner par un événement impossible n'a aucun sens: aucune information ne peut nous dire qu'une chose de probabilité nulle s'est produite. Le cas des conditionnements de probabilité nulle (par exemple «sachant que X=2,7» pour une variable continue) demande une construction différente, que le chapitre 7 abordera par la densité conditionnelle.
La probabilité conditionnelle est une probabilité
L'intuition «on restreint l'univers à B» a un contenu mathématique précis: l'application qui à A associe P(A∣B) vérifie les axiomes de Kolmogorov du chapitre 1. Tout ce que nous avons démontré sur les probabilités reste donc vrai pour un conditionnement fixé, sans aucune redémonstration.
Démonstration.Positivité et majoration. Pour tout A, P(A∩B)≥0 et P(B)>0, donc PB(A)≥0. Comme A∩B⊂B, la croissance de P (chapitre 1) donne P(A∩B)≤P(B), d'où PB(A)≤1.
Masse totale.Ω∩B=B, donc PB(Ω)=P(B)/P(B)=1.
σ-additivité. Soit (An)n≥1 une suite d'événements deux à deux disjoints. Les événements An∩B sont eux aussi deux à deux disjoints, car (An∩B)∩(Am∩B)⊂An∩Am=∅ pour n=m. La σ-additivité de P donne alors
l'interversion de la somme et de la division étant licite puisque P(B) est une constante strictement positive et que la série converge (ses sommes partielles sont majorées par 1).
Les deux conséquences annoncées ne sont alors que la probabilité du complémentaire et la formule du crible à deux termes du chapitre 1, appliquées à PB. □
Question 2.1
On tire une carte d'un jeu de 52 cartes. Sachant que la carte tirée est une figure (valet, dame ou roi), quelle est la probabilité que ce soit un roi?
La formule des probabilités composées
De la définition à la règle de calcul
Lue de droite à gauche, la définition (2.1) devient une formule de calcul: au lieu de déduire la probabilité conditionnelle d'une probabilité jointe, on construit la probabilité jointe à partir de probabilités conditionnelles que le modèle nous donne directement. C'est ce sens de lecture qui est utile, car dans une expérience séquentielle les données naturelles sont précisément les probabilités de chaque étape sachant ce qui a précédé.
Démonstration. Remarquons d'abord que l'hypothèse a un sens: la suite A1⊃A1∩A2⊃… est décroissante, donc P(A1∩⋯∩Ak)≥P(A1∩⋯∩An−1)>0 pour tout k≤n−1, et tous les conditionnements écrits sont légitimes.
Procédons par récurrence sur n. Pour n=2, la définition (2.1) appliquée à A2 sachant A1 s'écrit P(A2∣A1)=P(A1∩A2)/P(A1), d'où P(A1∩A2)=P(A1)P(A2∣A1).
Supposons la formule vraie au rang n−1 et posons E=A1∩⋯∩An−1, de probabilité strictement positive. Le cas n=2 appliqué à E et An donne P(E∩An)=P(E)P(An∣E), et l'hypothèse de récurrence développe P(E) en le produit des n−1 premiers facteurs. En les concaténant on obtient (2.2). □
Une autre façon de voir (2.2): le produit est télescopique. Chaque facteur est un quotient P(A1∩⋯∩Ak)/P(A1∩⋯∩Ak−1), et tous les termes intermédiaires se simplifient. Cette lecture explique pourquoi l'ordre dans lequel on énumère les événements est libre: on peut conditionner dans l'ordre chronologique, mais aussi dans n'importe quel autre, et le produit vaut toujours P(A1∩⋯∩An).
Lire un arbre pondéré
La formule (2.2) se dessine. Un arbre pondéré représente une expérience séquentielle: chaque nœud est un état de connaissance, chaque branche porte la probabilité conditionnelle de l'étape sachant tout le chemin parcouru, et chaque feuille porte la probabilité de l'intersection correspondante. Les règles de lecture sont exactement les théorèmes de ce chapitre:
on multiplie le long d'un chemin (formule des probabilités composées);
on additionne les feuilles qui réalisent un même événement (additivité, puisque des chemins distincts correspondent à des événements disjoints);
la somme des branches issues d'un même nœud vaut 1 (c'est PB(Ω)=1 du théorème 2.1), et la somme de toutes les feuilles vaut 1.
Ces deux dernières égalités sont des vérifications gratuites: prenez l'habitude de les faire avant d'exploiter un arbre. Nous les vérifierons explicitement sur l'arbre du dépistage.
Question 2.2
Une urne contient 6 boules blanches et 4 noires. On tire deux boules sans remise. Quelle est la probabilité que la deuxième soit noire sachant que la première l'était?
Système complet d'événements et probabilités totales
Découper l'univers
La plupart des situations réelles se présentent ainsi: l'événement qui nous intéresse peut survenir pour plusieurs raisons mutuellement exclusives, et l'on connaît sa probabilité sous chacune de ces raisons. Il faut alors recomposer le tout. Le découpage porte un nom.
Le système complet le plus simple est {B,Bˉ} dès que 0<P(B)<1. Le plus courant en pratique est la liste des «causes» possibles d'un phénomène: les trois machines d'un atelier, les quatre fournisseurs d'un composant, les deux états de santé d'un patient.
Figure 2.1. Un système complet de trois événements et un événement A qui les traverse. La largeur de chaque bloc est proportionnelle à sa probabilité, la hauteur de la bande A à la probabilité conditionnelle de A dans ce bloc: l'aire de chaque morceau de la bande est donc proportionnelle au terme correspondant de la formule des probabilités totales, et son aire totale à P(A). Valeurs illustratives, fictives.
Démonstration. Puisque les Bi recouvrent Ω,
A=A∩Ω=A∩(i∈I⋃Bi)=i∈I⋃(A∩Bi),
par distributivité de l'intersection sur la réunion. Les événements A∩Bi sont deux à deux incompatibles, car (A∩Bi)∩(A∩Bj)⊂Bi∩Bj=∅ pour i=j. La σ-additivité de P (axiome de Kolmogorov, chapitre 1) donne donc la première égalité de (2.3). La seconde s'obtient en appliquant à chaque terme la formule des probabilités composées, P(A∩Bi)=P(A∣Bi)P(Bi), légitime puisque P(Bi)>0. □
La formule (2.3) est une moyenne pondérée: P(A) est la moyenne des probabilités conditionnelles P(A∣Bi), pondérée par les probabilités des blocs. Il en résulte un encadrement souvent utile:
iminP(A∣Bi)≤P(A)≤imaxP(A∣Bi).
Une probabilité globale ne peut donc jamais sortir de l'intervalle balayé par ses probabilités conditionnelles — un contrôle d'ordre de grandeur qui repère beaucoup d'erreurs de calcul.
Question 2.3
Remettez dans l'ordre les étapes d'un calcul de probabilité a posteriori.
Glissez les éléments pour les mettre dans le bon ordre
1.
Calculer la probabilité de l'observation par la formule des probabilités totales
2.
Écrire les vraisemblances: la probabilité de l'observation sachant chaque cause
3.
Écrire les probabilités a priori de chaque cause
4.
Diviser le produit (a priori × vraisemblance) de la cause visée par cette probabilité totale
5.
Choisir un système complet d'événements (les causes possibles) et nommer l'événement observé
La formule de Bayes
Renverser un conditionnement
Nous savons calculer P(A∣B) quand le modèle nous donne P(B∣A); il reste à écrire la formule qui effectue ce renversement. Elle tient en une ligne, mais c'est probablement la ligne la plus lourde de conséquences de tout le cours.
Démonstration. La formule des probabilités composées, écrite dans les deux ordres possibles, donne
P(A∩B)=P(A∣B)P(B)=P(B∣A)P(A).
Comme P(B)>0, on peut diviser par P(B) les deux membres extrêmes, ce qui est (2.5). Pour (2.6), on applique (2.5) au couple (Bk,A): le numérateur est P(A∣Bk)P(Bk) et le dénominateur P(A), que la formule des probabilités totales (2.3) développe en la somme annoncée. □
La démonstration est courte parce que Bayes n'ajoute rien: c'est la symétrie de A∩B combinée à une division. Sa portée vient de l'interprétation, qui mérite un vocabulaire propre.
Deux idées à retenir, et une à ne jamais oublier.
Bayes inverse un conditionnement. Il transforme «probabilité de l'observation sachant la cause» en «probabilité de la cause sachant l'observation». Or c'est presque toujours la première que la science ou la technique nous fournit (un laboratoire mesure la sensibilité d'un test sur des malades connus, un fabricant mesure le taux de panne d'un composant), et la seconde que nous voulons (ce patient est-il malade? ce composant est-il en cause?).
Bayes est une règle de mise à jour. La forme «posterior ∝ prior × vraisemblance» montre que l'observation multiplie la croyance initiale par un facteur; la normalisation ne fait que ramener la somme à 1. Si l'on reçoit deux observations successives, on peut appliquer Bayes deux fois de suite, le posterior de la première servant de prior à la seconde; l'exercice 2.3 vérifie que le résultat est identique au calcul direct.
Le prior ne s'évapore jamais. Aussi convaincante que soit l'observation, elle ne dispense pas de connaître P(Bk). Oublier le prior — traiter P(Bk∣A) comme s'il valait P(A∣Bk) — est l'erreur de raisonnement la plus coûteuse de la discipline. Elle a un nom et une section, plus bas.
L'exemple qui fait tout comprendre: le dépistage «Test D»
Nous utilisons ici un test de dépistage entièrement fictif, appelé Test D, pour une maladie elle aussi fictive. Les trois nombres qui le définissent sont ceux que tout le cours emploiera: aucun n'est emprunté à un test réel, et aucun ne doit être attribué à une institution ou à un laboratoire existant.
Figure 2.2. Arbre pondéré du dépistage fictif Test D. Chaque branche porte sa probabilité conditionnelle et son épaisseur est proportionnelle à celle-ci; chaque feuille porte la probabilité conjointe, produit des probabilités du chemin. Les deux feuilles encadrées sont celles qui donnent un test positif: leur somme est P(+) = 0,0593 et leur rapport est la réponse cherchée. La colonne de droite traduit les quatre probabilités en effectifs sur 10 000 personnes.
Étape 1 — poser le système complet. Les deux états de santé, M et Mˉ, forment un système complet d'événements: P(M)=0,01, P(Mˉ)=0,99, et 0,01+0,99=1.
Étape 2 — écrire les quatre probabilités conjointes. La formule des probabilités composées donne les quatre feuilles de l'arbre:
Chemin
Calcul
Probabilité
Sur 10 000 personnes
M∩+ (vrai positif)
0,01×0,98
0,0098
98
M∩− (faux négatif)
0,01×0,02
0,0002
2
Mˉ∩+ (faux positif)
0,99×0,05
0,0495
495
Mˉ∩− (vrai négatif)
0,99×0,95
0,9405
9 405
La somme des quatre vaut 0,0098+0,0002+0,0495+0,9405=1 exactement: la vérification annoncée plus haut est faite.
Étape 3 — probabilités totales. L'événement «le test est positif» se décompose sur le système complet:
Près de 6% des personnes dépistées seront déclarées positives, alors que 1% seulement sont malades. Le déséquilibre est déjà visible: sur les 0,0593, la part qui vient des bien-portants, 0,0495, est cinq fois plus grosse que celle qui vient des malades.
Étape 4 — Bayes. La question du patient est: «je suis positif, quelle est la probabilité que je sois malade?» C'est P(M∣+), et non P(+∣M):
Cette quantité s'appelle la valeur prédictive positive du test. Autrement dit: un test positif laisse encore plus de cinq chances sur six d'être en bonne santé, avec un test dont la sensibilité et la spécificité sont pourtant excellentes.
Étape 5 — l'autre côté. La valeur prédictive négative se calcule de même:
Un test négatif, lui, est presque une certitude: P(M∣−)=2/9407≈0,00021, soit environ deux malades sur dix mille personnes déclarées négatives. Le test est donc excellent pour écarter la maladie et médiocre pour la confirmer. C'est la raison pour laquelle un dépistage de masse est toujours suivi d'un examen de confirmation.
Pourquoi: la prévalence commande tout
Rien dans le calcul ci-dessus ne dépend de la qualité du test seule. Réécrivons (2.8) avec une prévalence p quelconque, une sensibilité Se et une spécificité Sp:
P(M∣+)=Se⋅p+(1−Sp)(1−p)Se⋅p.(2.9)
Quand p devient petit, le numérateur décroît proportionnellement à p, tandis que le second terme du dénominateur tend vers la constante 1−Sp: le rapport tend vers 0. Le tableau suivant, calculé avec la même sensibilité 0,98 et la même spécificité 0,95, montre le phénomène (toutes les valeurs sont recalculées, arrondies à la fin).
Prévalence p
P(+)
Valeur prédictive positive
Vrais positifs (sur 1000)
Faux positifs (sur 1000)
0,1%
0,05093
1,92%
0,98
49,95
1%
0,05930
16,53%
9,80
49,50
10%
0,14300
68,53%
98,00
45,00
Le nombre de faux positifs bouge à peine — il est gouverné par la spécificité appliquée à la population des bien-portants, qui reste presque toute la population. Le nombre de vrais positifs, lui, est directement proportionnel à la prévalence. La valeur prédictive positive n'est que le rapport des deux, et c'est donc la prévalence qui la pilote.
Explorateur 2.1 · Explorateur du dépistage: prévalence, sensibilité, spécificité
Test de dépistage fictif appliqué à 1000 personnes. La barre de gauche est à l'échelle de la population; celle de droite ne garde que les personnes déclarées positives et les renormalise, de sorte que sa partie VP, celle des vrais positifs, est exactement la valeur prédictive positive. Faites descendre la prévalence sans rien changer d'autre: la sensibilité et la spécificité ne bougent pas, et pourtant la valeur prédictive positive s'effondre.
Prévalence P(M)1,0%
Sensibilité P(+ | M)98,0%
Spécificité P(− | non-M)95,0%
P(+), part de tests positifs
5,93 %
Valeur prédictive positive P(M | +)
16,5 %
Valeur prédictive négative
99,98 %
Faux positifs par vrai positif
5,05
Question 2.4
Avec la même sensibilité de 0,98 et la même spécificité de 0,95, quelle est la valeur prédictive positive si la prévalence vaut 10%? Donnez une probabilité entre 0 et 1.
L'erreur du procureur
Chiffrons l'erreur du procureur sur un cas fictif, construit de toutes pièces pour l'exposé. Une trace biologique est retrouvée sur une scène. Le laboratoire établit que la probabilité qu'une personne prise au hasard dans la population présente le même profil vaut P(T∣Gˉ)=10−5, où T est l'événement «le profil correspond» et G «la personne est l'auteur». Un suspect est identifié et son profil correspond.
Le procureur conclut: «il y a une chance sur cent mille que ce soit un innocent». Il a remplacé P(G∣T) par 1−P(T∣Gˉ), ce que rien ne justifie. Faisons le calcul correct. Supposons que l'enquête n'ait, avant l'analyse, aucune raison de soupçonner ce suspect plutôt qu'une autre des 500000 personnes qui auraient pu matériellement commettre l'acte: le prior est P(G)=1/500000=2⋅10−6. La vraisemblance sous G est P(T∣G)=1 (l'auteur correspond certainement). Par les probabilités totales,
P(T)=1⋅5000001+10−5⋅500000499999=1,199998⋅10−5,
puis par Bayes
P(G∣T)=1,199998⋅10−52⋅10−6=599999100000≈0,1667.
Environ 16,7%, et non 99,999%. La raison est la même que pour le dépistage: dans une population de 500000 personnes, on attend environ cinq personnes innocentes au profil correspondant, contre un seul coupable. La correspondance est une preuve, et une preuve forte — elle a multiplié la probabilité par un facteur 83000 environ — mais elle ne suffit pas à elle seule. Si l'enquête avait par ailleurs réduit le cercle des suspects à mille personnes, le prior aurait été 10−3 et le posterior P(G∣T)≈0,990: le même indice, une conclusion opposée. Le prior fait partie de la preuve.
Question 2.5
Un test de dépistage a une sensibilité de 99% et une spécificité de 99%. La maladie touche une personne sur dix mille. Quelle est approximativement la valeur prédictive positive?
L'indépendance
Deux événements
Conditionner change en général les probabilités. Le cas où cela ne change rien mérite un nom: c'est le cas où l'information apportée par B est sans valeur pour prédire A.
Cette définition est symétrique en A et B et ne suppose aucune probabilité strictement positive: c'est pour ces deux raisons qu'on la préfère à la formulation conditionnelle, à laquelle elle est pourtant équivalente dès que le conditionnement est licite.
Démonstration.1. Si P(B)>0, la définition (2.1) donne P(A∣B)P(B)=P(A∩B). L'égalité (2.10) équivaut donc à P(A∣B)P(B)=P(A)P(B), c'est-à-dire, après division par P(B)>0, à P(A∣B)=P(A).
3. Supposons (2.10). Comme A=(A∩B)∪(A∩Bˉ) est une réunion disjointe,
donc A⊥Bˉ. Par symétrie de (2.10) en ses deux arguments, on obtient Aˉ⊥B, puis en appliquant une seconde fois le raisonnement, Aˉ⊥Bˉ.
2. Si 0<P(B)<1, les deux conditionnements sont définis. Si A⊥B, le point 1 donne P(A∣B)=P(A) et le point 3 suivi du point 1 donne P(A∣Bˉ)=P(A): les deux sont égaux. Réciproquement, si P(A∣B)=P(A∣Bˉ)=c, la formule des probabilités totales (2.4) donne P(A)=cP(B)+cP(Bˉ)=c, donc P(A∣B)=P(A) et l'on conclut par le point 1. □
Le point 2 est la lecture la plus parlante: A et B sont indépendants exactement lorsque savoir si B s'est produit ou non ne modifie pas la probabilité de A. Le point 3 est indispensable en pratique — c'est lui qui autorise, dans les calculs de fiabilité, à passer de «les composants fonctionnent indépendamment» à «les composants tombent en panne indépendamment».
Question 2.6
Soient A et B deux événements avec P(A)=0,4 et P(B)=0,5. Laquelle de ces affirmations est nécessairement fausse?
Indépendance mutuelle de n événements
Pour plus de deux événements, la bonne définition n'est pas celle qu'on écrirait spontanément.
Pour n événements, la définition impose 2n−n−1 égalités: pour n=3, ce sont les trois égalités deux à deux plus l'égalité triple, soit quatre conditions. L'indépendance mutuelle entraîne évidemment l'indépendance deux à deux. La réciproque est fausse, et le contre-exemple suivant, dû à Sergueï Bernstein, est le plus économique qui soit.
Indépendance conditionnelle
Un conditionnement peut créer une dépendance là où il n'y en avait pas, ou détruire une dépendance existante. Il faut donc un troisième concept.
C'est simplement l'indépendance au sens de (2.10), mais pour la probabilité PC du théorème 2.1 — une nouvelle illustration de ce que ce théorème fait gagner. L'indépendance conditionnelle n'entraîne pas l'indépendance, et l'indépendance n'entraîne pas l'indépendance conditionnelle. Les deux exemples suivants le montrent, chacun dans un sens.
Trois applications numériques
Fiabilité d'un système en série et en parallèle
Un système est constitué de n composants dont on suppose les fonctionnements mutuellement indépendants. On note Ri=P(Ci) la fiabilité du composant i, c'est-à-dire la probabilité qu'il fonctionne pendant la mission considérée, et R celle du système.
Montage en série. Le système fonctionne si et seulement si tous les composants fonctionnent. Par indépendance mutuelle,
Rseˊrie=P(C1∩⋯∩Cn)=i=1∏nRi.(2.13)
Montage en parallèle. Le système fonctionne si au moins un composant fonctionne. On passe au complémentaire — le système tombe en panne si tous les composants tombent en panne — et le point 3 du théorème 2.5, étendu à n événements, autorise à multiplier les 1−Ri:
Rparalleˋle=1−i=1∏n(1−Ri).(2.14)
Figure 2.3. Les deux montages de base, avec des composants identiques et indépendants de fiabilité 0,90. En série, la fiabilité chute à 0,729; en parallèle, elle monte à 0,99. Les deux barres du bas donnent les probabilités de défaillance sur une même échelle: la redondance divise le risque par vingt-sept.
Deux conséquences se lisent directement sur les formules. En série, la fiabilité est inférieure à celle du plus faible composant: une chaîne de 50 composants à 0,99 ne vaut plus que 0,9950≈0,605. En parallèle, au contraire, la fiabilité est supérieure à celle du meilleur composant, et la probabilité de panne décroît géométriquement: avec des composants à 0,80, il suffit de cinq branches en parallèle pour atteindre 1−0,25=0,99968.
Question 2.7
Trois composants indépendants de fiabilité 0,90 chacun sont montés en parallèle. Quelle est la fiabilité du système?
Un contrôle industriel à deux étages
Une ligne de production fabrique des pièces dont une proportion P(D)=0,03 est défectueuse (données fictives). Chaque pièce passe deux contrôles successifs, conçus pour être indépendants conditionnellement à l'état de la pièce. Le premier contrôle rejette une pièce défectueuse avec probabilité 0,90, le second avec probabilité 0,80. Chaque contrôle rejette aussi à tort une pièce conforme avec probabilité 0,02 (fausse alarme). Une pièce est acceptée si elle passe les deux contrôles.
Vraisemblances. Conditionnellement à l'état de la pièce, les deux contrôles sont indépendants, donc
soit environ 644 pièces défectueuses par million livrées, contre 30000 par million à l'entrée: les deux étages ont divisé le taux de défauts par 47. Mais regardons aussi le rebut. La probabilité de rejeter une pièce est 1−0,932188=0,067812, soit 6,8% de la production, et
Plus de la moitié des pièces rejetées sont conformes. C'est la structure du Test D transposée à l'atelier: les pièces conformes sont 32 fois plus nombreuses que les défectueuses, et il suffit d'un petit taux de fausse alarme pour qu'elles dominent le rebut. Le coût du contrôle n'est pas seulement celui des appareils: c'est aussi celui des bonnes pièces jetées, et l'arbitrage entre les deux se décide sur ces deux probabilités a posteriori, pas sur les taux de détection annoncés par le fournisseur des appareils.
Le problème de Monty Hall
Voici le problème le plus discuté de la théorie des probabilités élémentaire. Un candidat fait face à trois portes. Derrière l'une d'elles se trouve une voiture, derrière les deux autres une chèvre. Le candidat désigne une porte, disons la porte 1. Le présentateur, qui sait où est la voiture, ouvre alors une autre porte, disons la porte 3, découvrant une chèvre. Il propose au candidat de changer son choix pour la porte 2. Le candidat a-t-il intérêt à changer?
Ici, poser les hypothèses est le travail mathématique. Le problème n'a pas de réponse tant que le comportement du présentateur n'est pas spécifié; c'est la source de tous les désaccords qu'il a provoqués. Posons donc:
(H1) La voiture est placée derrière l'une des trois portes, chacune avec la probabilité 1/3, indépendamment du choix du candidat.
(H2) Le présentateur sait où se trouve la voiture.
(H3) Il ouvre toujours une porte, jamais celle choisie par le candidat, et toujours une porte cachant une chèvre.
(H4) Lorsqu'il a le choix entre deux portes — c'est-à-dire lorsque le candidat a désigné la bonne porte — il en ouvre une au hasard, chacune avec la probabilité 1/2.
Notons Vk l'événement «la voiture est derrière la porte k» et H3 l'événement «le présentateur ouvre la porte 3», le candidat ayant choisi la porte 1. Les Vk forment un système complet: P(V1)=P(V2)=P(V3)=1/3 par (H1).
Vraisemblances, données par (H3) et (H4):
P(H3∣V1)=21,P(H3∣V2)=1,P(H3∣V3)=0.
La première vient de (H4): si la voiture est derrière la porte 1, les portes 2 et 3 cachent toutes deux une chèvre et le présentateur tire au sort. La deuxième: si la voiture est derrière la porte 2, la seule porte qu'il peut ouvrir est la 3. La troisième: il n'ouvre jamais la porte qui cache la voiture.
Le candidat qui garde la porte 1 gagne avec probabilité 1/3; celui qui change pour la porte 2 gagne avec probabilité 2/3. Il faut donc changer: la stratégie double les chances.
Où est l'intuition? Dans le fait que l'ouverture de la porte 3 n'apporte aucune information sur la porte 1 — le présentateur allait de toute façon ouvrir une porte à chèvre, quelle que soit la position de la voiture, et P(H3)=1/2 ne dépend pas de V1 — alors qu'elle en apporte sur la porte 2. La probabilité 1/3 de la porte 1 est figée au moment du choix initial, et les 2/3 restants, initialement répartis sur les portes 2 et 3, se concentrent tout entiers sur la porte 2. Le jeu avec dix portes rend cela évident: vous en choisissez une (probabilité 1/10), le présentateur ouvre huit portes à chèvre, et la seule porte restante porte les 9/10.
Synthèse
Conditionner, c'est renormaliser.P(A∣B)=P(A∩B)/P(B) pour P(B)>0; l'application A↦P(A∣B) est une probabilité au sens de Kolmogorov (théorème 2.1), de sorte que tous les résultats du chapitre 1 s'y transportent sans nouvelle démonstration.
Trois formules, une seule idée. Les probabilités composées construisent une probabilité conjointe le long d'un chemin, les probabilités totales recomposent un événement sur un système complet, et Bayes combine les deux pour inverser un conditionnement: de P(A∣Bi) vers P(Bi∣A). Sur un arbre pondéré, on multiplie le long des chemins et on additionne les feuilles.
Le prior n'est pas négociable. La probabilité a posteriori est proportionnelle au produit de la probabilité a priori par la vraisemblance. Sur le Test D fictif, une sensibilité de 0,98 et une spécificité de 0,95 donnent P(+)=0,0593 et une valeur prédictive positive de 0,0098/0,0593≈16,5%: sur une maladie rare, la plupart des positifs sont des faux positifs. Confondre P(A∣B) et est l'erreur du procureur.
Indépendance et incompatibilité sont des contraires.A⊥B signifie P(A∩B)=P(A)P(B), c'est-à-dire P(A∣B)=P(A); deux événements incompatibles de probabilité positive sont toujours dépendants, puisque P(A∣B)=0.
Deux à deux ne suffit pas. L'indépendance mutuelle de n événements exige les 2n−n−1 égalités produits. Le contre-exemple de Bernstein (deux pièces, A, B et «résultats égaux») donne trois événements indépendants deux à deux avec P(A∩B∩C)=1/4=1/8.
Le conditionnement déplace les dépendances. Conditionner par une cause commune supprime la dépendance entre ses effets; conditionner par un effet commun en crée une entre ses causes (effet d'explication). En fiabilité, Rseˊrie=∏Ri et Rparalleˋle=1−∏(1−Ri) ne valent que sous indépendance mutuelle — hypothèse de conception, jamais gratuite.
Série d'exercices du chapitre 2Exercice 1 sur 5
Question 2.8
Pour que P(A∣B) soit définie, il faut et il suffit que:
Problème guidé 2.1 · Un filtre anti-spam bayésien
Un service de messagerie (données fictives) reçoit 60% de courriels indésirables. Le mot «gratuit» apparaît dans 20% des courriels indésirables et dans 1% des courriels légitimes. Un courriel arrive, contenant le mot «gratuit». On note S l'événement «le courriel est indésirable» et W l'événement «le courriel contient le mot». Il s'agit de calculer P(S∣W), puis d'examiner ce que change l'arrivée d'un second indice.
1
Identifier le système complet et les vraisemblances
Les deux états possibles du courriel, indésirable ou légitime, forment un système complet d'événements.
Question
Parmi ces quatre nombres, lequel est la probabilité a priori de S?
Probabilité de l'observation
Probabilité a posteriori
Ce que change l'absence du mot
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Exercice 2.1 · Conditionnements élémentaires
On lance deux dés équilibrés discernables. Calculer P(somme≥10∣le premier deˊ donne 5) et P(le premier deˊ donne 5∣somme≥10). Commenter l'écart.
On tire deux cartes sans remise d'un jeu de 52. Calculer la probabilité que les deux soient des cœurs, d'abord par la formule des probabilités composées, puis par dénombrement.
Une famille a deux enfants, chacun garçon ou fille avec probabilité 1/2, indépendamment. Calculer P(deux filles∣au moins une fille) et P(deux filles∣l’aıˆneˊe est une fille). Pourquoi les deux réponses diffèrent-elles?
Solution
1. L'univers compte 36 issues équiprobables. L'événement A={somme≥10} contient (4,6), (5,5), (6,4), (5,6), , : . L'événement contient six issues, , et , de probabilité . Donc
Exercice 2.2 · Probabilités totales et arbre pondéré
Une entreprise de transport (données fictives) exploite trois types de véhicules: 45% de type T1, 35% de type T2 et 20% de type T3. La probabilité qu'un véhicule subisse au moins une panne dans l'année vaut 0,08 pour T1, 0,12 pour T2 et 0,25 pour T3.
Vérifier que les trois types forment un système complet, puis calculer la probabilité qu'un véhicule pris au hasard tombe en panne dans l'année.
Un véhicule est tombé en panne. Calculer la probabilité qu'il soit de type T3, et vérifier que les trois probabilités a posteriori somment à 1.
L'entreprise remplace tous les T3 par des T1. Quel est le nouveau taux de panne? De combien de points a-t-il baissé?
Solution
1. Les trois types sont deux à deux incompatibles (un véhicule a un seul type), ils recouvrent le parc, et 0,45+0,35+0,20=1: c'est bien un système complet. Avec P l'événement «au moins une panne dans l'année», la formule (2.3) donne
On reprend le Test D fictif du cours: P(M)=0,01, sensibilité 0,98, spécificité 0,95. Une personne dépistée positive est soumise une seconde fois au même test, dont on suppose les deux applications indépendantes conditionnellement à l'état de santé.
Calculer P(++∣M) et P(++∣Mˉ), puis P(++).
Calculer P(M∣++).
Vérifier que l'on obtient le même résultat en utilisant la probabilité a posteriori du premier test, 98/593, comme probabilité a priori du second. Commenter.
Que vaut P(M∣+−), lorsque le second test contredit le premier?
Solution
1. L'hypothèse d'indépendance conditionnelle donne directement les vraisemblances de la paire de résultats:
P(++∣M)=0,982=0,9604,P(++∣Mˉ)=0,052=0,0025.
Exercice 2.4 · Indépendance: preuves et contre-exemples
Soient A et B indépendants avec P(A)=0,3 et P(B)=0,5. Calculer P(A∪B), P(Aˉ∩Bˉ) et P(A∣A∪B).
Montrer que si A est indépendant de lui-même, alors P(A)∈{0,1}.
Montrer que Ω et ∅ sont indépendants de tout événement.
On lance deux dés équilibrés. Soient A={le premier deˊ donne un nombre impair}, B={le second deˊ donne un nombre impair} et C={la somme est impaire}. Montrer que A, B, sont indépendants deux à deux mais non mutuellement indépendants.
Solution
1. Par la formule du crible et l'indépendance, P(A∩B)=0,3⋅0,5=0,15, donc
P(A∪B)=0,3+0,5−0,15=0,65.
Exercice 2.5 · Fiabilité, redondance et hypothèses
Un système de commande comporte un capteur, une unité de calcul et un actionneur, montés en série, de fiabilités respectives 0,97, 0,99 et 0,96 sur la durée d'une mission. Les trois composants sont supposés indépendants.
Calculer la fiabilité du système et sa probabilité de défaillance.
On double l'actionneur, le plus faible des trois: deux actionneurs identiques en parallèle, indépendants. Calculer la nouvelle fiabilité et le gain.
Combien d'actionneurs en parallèle faudrait-il pour que le sous-système actionneur atteigne une fiabilité d'au moins 0,9999?
On apprend que les deux actionneurs du point 2 partagent la même alimentation, laquelle tombe en panne avec probabilité 0,01; conditionnellement au bon fonctionnement de l'alimentation, les actionneurs restent indépendants avec fiabilité 0,96, et si l'alimentation tombe en panne, aucun ne fonctionne. Recalculer la fiabilité du sous-système actionneur et commenter.
Solution
1. Par (2.13),
R=0,97×0,99×0,96=0,9219168≈0,9219,
et la probabilité de défaillance vaut 1−R=0,0780832≈0,0781. Elle est presque la somme des trois probabilités de panne individuelles (): pour de petits risques indépendants, les risques en série s'additionnent approximativement.
Références
Ross, S. M., Initiation aux probabilités, Presses polytechniques et universitaires romandes, Lausanne — chapitre 3 (probabilité conditionnelle et indépendance), avec de nombreux exemples de dépistage.
Saporta, G., Probabilités, analyse des données et statistique, Technip, Paris — chapitre 2 pour la formule de Bayes et le vocabulaire a priori / a posteriori.
Morgenthaler, S., Introduction à la statistique, Presses polytechniques et universitaires romandes, Lausanne — conditionnement et indépendance dans un cadre d'ingénieur.
Dodge, Y., Statistique — dictionnaire encyclopédique, Springer, Paris — entrées «probabilité conditionnelle», «théorème de Bayes», «sensibilité et spécificité».
Wackerly, D., Mendenhall, W. et Scheaffer, R., Mathematical Statistics with Applications, Cengage, Boston — chapitre 2, en particulier les exercices sur la fiabilité des systèmes.
Rice, J. A., Mathematical Statistics and Data Analysis, Duxbury, Belmont — chapitre 1, pour le problème de Monty Hall traité par conditionnement explicite.
20/120=1/6
18472/54145≈0,3412
D
□
2
P(Aj∩Ak)=1/4
j=k
P(A1∩A2∩A3)=1/4=1/8
U2
0,04
0,5
informationnelle
0,05
P(B∣A)
(6,5)
(6,6)
P(A)=6/36=1/6
B={premier deˊ=5}
P(B)=1/6
A∩B={(5,5),(5,6)}
2/36=1/18
P(A∣B)=1/61/18=31≈0,3333,P(B∣A)=1/61/18=31.
Ici les deux coïncident, mais par accident: c'est parce que P(A)=P(B)=1/6, et la formule de Bayes donne alors P(A∣B)/P(B∣A)=P(A)/P(B)=1. Remplacez A par {somme≥11} (trois issues, probabilité 1/12): alors A∩B={(5,6)}, P(A∣B)=(1/36)/(1/6)=1/6 tandis que P(B∣A)=(1/36)/(1/12)=1/3, deux fois plus. La coïncidence du premier calcul ne doit donc rien enseigner.
2. Notons Ck l'événement «la k-ième carte est un cœur». Par les probabilités composées,
Par dénombrement: il y a (252)=1326 paires équiprobables et (213)=78 paires de cœurs, soit 78/1326=1/17. Les deux méthodes concordent. Remarquez que P(C2∣C1)=12/51≈0,2353 est inférieur à P(C2)=1/4: sans remise, un cœur déjà sorti appauvrit l'urne.
3. L'univers est Ω={GG,GF,FG,FF}, équiprobable (G garçon, F fille, l'aîné en premier).
Premier conditionnement. «Au moins une fille» est l'événement {GF,FG,FF}, de probabilité 3/4, et son intersection avec {FF} est {FF}:
P(FF∣au moins une fille)=3/41/4=31.
Second conditionnement. «L'aînée est une fille» est {FG,FF}, de probabilité 1/2, d'où
P(FF∣aıˆneˊe fille)=1/21/4=21.
Les deux informations ne sont pas les mêmes. «Au moins une fille» laisse trois issues possibles, dont deux comportent un garçon; «l'aînée est une fille» en laisse deux, dont une seule comporte un garçon. Le conditionnement le plus précis — il désigne quel enfant est une fille — élimine davantage d'issues et donne une probabilité plus grande. C'est un excellent entraînement à ne jamais conditionner «en gros»: il faut écrire l'événement en extension.
soit 12,8%. La valeur est bien comprise entre 0,08 et 0,25, comme l'exige l'encadrement des probabilités totales.
De même P(T1∣P)=0,036/0,128=9/32=0,28125 et P(T2∣P)=0,042/0,128=21/64=0,328125. Somme:
6418+6421+6425=6464=1.
Le type T3, qui ne représente que 20% du parc, cause 39% des pannes: c'est lui qu'il faut traiter en priorité.
3. Le parc devient 65% de T1 et 35% de T2, donc
P(P)=0,65⋅0,08+0,35⋅0,12=0,052+0,042=0,094,
soit 9,4%. La baisse est de 12,8−9,4=3,4 points de pourcentage, c'est-à-dire une réduction relative de 3,4/12,8≈26,6% du nombre de pannes. Notez que remplacer 20% du parc supprime bien plus que 20% des pannes, précisément parce que ces véhicules étaient surreprésentés parmi les pannes.
La croyance passe de 16,5% après un test à 79,5% après deux. C'est considérable, mais toujours pas une certitude: une personne sur cinq déclarée deux fois positive reste en bonne santé.
3. Prenons p1=98/593≈0,165261 comme prior et appliquons Bayes au second test seul:
C'est exactement le résultat du point 2. La mise à jour bayésienne est séquentielle: on peut traiter les observations une à une, dans n'importe quel ordre, ou toutes ensemble. Cette propriété est ce qui fait de Bayes une machine à apprendre, et elle repose entièrement sur l'hypothèse d'indépendance conditionnelle: si les deux applications du test partageaient un biais commun (même appareil mal étalonné, même particularité biologique du patient), la seconde n'apporterait presque rien et le calcul surestimerait la certitude.
4. Les vraisemblances d'un positif suivi d'un négatif sont 0,98⋅0,02=0,0196 sous M et 0,05⋅0,95=0,0475 sous Mˉ. Donc
Un résultat discordant ramène la probabilité à 0,42%, en dessous même de la prévalence initiale de 1%: le test négatif, très informatif, l'emporte largement sur le positif.
C
Par le point 3 du théorème 2.5, Aˉ et Bˉ sont indépendants: P(Aˉ∩Bˉ)=0,7⋅0,5=0,35, ce qui vérifie bien 1−0,65. Enfin, comme A⊂A∪B,
P(A∣A∪B)=P(A∪B)P(A)=0,650,3=136≈0,4615.
2. L'indépendance de A avec lui-même s'écrit P(A∩A)=P(A)2, c'est-à-dire P(A)=P(A)2, soit P(A)(1−P(A))=0. Donc P(A)=0 ou P(A)=1. Interprétation: les seuls événements qui ne s'informent pas eux-mêmes sont ceux qui ne comportent aucune incertitude.
3. Pour tout A: P(Ω∩A)=P(A)=1⋅P(A)=P(Ω)P(A), et P(∅∩A)=P(∅)=0=0⋅P(A). Les deux égalités (2.10) sont satisfaites. C'est cohérent avec le point 2: Ω et ∅ sont indépendants d'eux-mêmes. C'est aussi le seul cas où un événement peut être à la fois incompatible avec A et indépendant de A.
4. Chacun des trois événements a la probabilité 1/2: il y a 18 issues avec premier dé impair, 18 avec second dé impair, et la somme est impaire lorsque exactement un des deux dés est impair, ce qui fait 3⋅3+3⋅3=18 issues.
Deux à deux.A∩B correspond aux deux dés impairs: 3⋅3=9 issues, P(A∩B)=9/36=1/4=P(A)P(B). A∩C signifie «premier impair et somme impaire», donc premier impair et second pair: 3⋅3=9 issues, P(A∩C)=1/4. De même P(B∩C)=1/4. Les trois conditions de cardinal 2 sont vérifiées.
Mutuellement.A∩B∩C demande les deux dés impairs et une somme impaire; or la somme de deux impairs est paire. L'intersection est vide:
P(A∩B∩C)=0=81=P(A)P(B)P(C).
Les trois événements ne sont donc pas mutuellement indépendants. C'est le contre-exemple de Bernstein, avec la parité au lieu de l'égalité — et cette fois l'écart est maximal, puisque l'intersection triple est vide alors que le produit vaut 1/8.
0,03+0,01+0,04=0,08
2. Le sous-système actionneur a maintenant, par (2.14), la fiabilité 1−(1−0,96)2=1−0,0016=0,9984. Le système complet vaut donc
R′=0,97×0,99×0,9984=0,95866752≈0,9587,
et sa probabilité de défaillance 0,0413. La redondance d'un seul composant a réduit le risque de 0,0781 à 0,0413, soit une division par 1,89. Le risque résiduel est maintenant dominé par le capteur (0,03): c'est lui qu'il faudrait doubler ensuite. C'est la règle générale — on redonde le maillon faible, et le maillon faible change après chaque redondance.
3. On cherche le plus petit n tel que 1−0,04n≥0,9999, c'est-à-dire 0,04n≤10−4. Or 0,042=1,6⋅10−3 et 0,043=6,4⋅10−5≤10−4. Donc n=3 suffit, et donne R=0,999936. Par le calcul direct: n≥ln(10−4)/ln(0,04)=9,2103/3,2189≈2,86, d'où n=3.
4. Notons E l'événement «l'alimentation fonctionne», P(E)=0,99. Conditionnellement à E, le sous-système fonctionne avec probabilité 1−0,042=0,9984; conditionnellement à Eˉ, avec probabilité 0. Par les probabilités totales,
Ract=0,99×0,9984+0,01×0=0,988416≈0,9884.
La probabilité de défaillance du sous-système passe de 0,0016 à 0,011584, soit plus de sept fois plus. Et elle ne descendra jamais en dessous de 0,01, quel que soit le nombre d'actionneurs ajoutés: l'alimentation commune impose un plancher. C'est la défaillance de cause commune, et c'est la raison pour laquelle les systèmes critiques exigent une redondance physiquement séparée — alimentations distinctes, câblages distincts, locaux distincts, parfois technologies distinctes. Sur le plan probabiliste, c'est exactement l'exemple 2.7: les deux actionneurs sont indépendants conditionnellement à l'alimentation, pas inconditionnellement, et écrire (2.14) sans ce conditionnement revient à ignorer la cause commune.