Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
- définir la probabilité conditionnelle , l'interpréter comme une restriction de l'univers à , et démontrer qu'elle est elle-même une probabilité au sens des axiomes de Kolmogorov;
- décomposer une expérience séquentielle par la formule des probabilités composées et conduire le calcul sur un arbre pondéré;
- reconnaître un système complet d'événements et appliquer la formule des probabilités totales, puis la formule de Bayes, en nommant correctement les probabilités a priori, les vraisemblances et les probabilités a posteriori;
- calculer la valeur prédictive d'un test de dépistage et expliquer pourquoi, sur une maladie rare, la majorité des tests positifs sont des faux positifs;
- distinguer l'indépendance de l'incompatibilité, distinguer l'indépendance mutuelle de l'indépendance deux à deux, et construire un contre-exemple;
- modéliser et calculer la fiabilité d'un système en série et en parallèle, un contrôle industriel à deux étages, et résoudre le problème de Monty Hall en explicitant les hypothèses de modélisation.
Conditionner, c'est restreindre l'univers
Une information partielle change les probabilités
Le chapitre 1 a construit un espace probabilisé et posé les axiomes de Kolmogorov. Toutes les probabilités y étaient calculées «à froid», avant toute observation. Or, dans la pratique, on dispose presque toujours d'une information partielle: le médecin connaît le résultat d'un test, l'ingénieur sait que la machine s'est arrêtée, l'assureur sait que le conducteur a moins de 25 ans. Cette information ne change pas le hasard; elle change ce que nous savons de lui, donc les probabilités que nous devons lui attribuer.
Prenons l'exemple le plus dépouillé. On lance deux dés équilibrés discernables; l'univers compte issues équiprobables (chapitre 1). L'événement contient les cinq issues , , , , , donc . Supposons maintenant que l'on nous annonce le résultat du premier dé: c'est un . Les issues encore possibles ne sont plus que six, à , et une seule d'entre elles réalise . La probabilité de vaut donc .
Ce calcul contient tout le mécanisme. On a remplacé l'univers par le sous-ensemble , et l'on a compté, à l'intérieur de , la proportion d'issues favorables à . En termes de probabilités:
Le rapport final ne fait plus intervenir le dénombrement: il a un sens dans tout espace probabilisé, équiprobable ou non. C'est la définition.
Trois remarques s'imposent immédiatement.
La barre n'est pas un symbole d'ensemble. ne se lit pas «la probabilité de l'événement »: il n'existe aucun événement dans . La barre est une notation pour un nouveau nombre construit à partir de deux événements, et l'ordre des deux arguments est essentiel — c'est tout l'objet de la formule de Bayes, plus bas.
Le dénominateur renormalise. En divisant par , on redonne à la masse totale : . C'est exactement l'opération «on se place à l'intérieur de ».
La condition n'est pas un détail technique. Conditionner par un événement impossible n'a aucun sens: aucune information ne peut nous dire qu'une chose de probabilité nulle s'est produite. Le cas des conditionnements de probabilité nulle (par exemple «sachant que » pour une variable continue) demande une construction différente, que le chapitre 7 abordera par la densité conditionnelle.
La probabilité conditionnelle est une probabilité
L'intuition «on restreint l'univers à » a un contenu mathématique précis: l'application qui à associe vérifie les axiomes de Kolmogorov du chapitre 1. Tout ce que nous avons démontré sur les probabilités reste donc vrai pour un conditionnement fixé, sans aucune redémonstration.
Démonstration. Positivité et majoration. Pour tout , et , donc . Comme , la croissance de (chapitre 1) donne , d'où .
Masse totale. , donc .
-additivité. Soit une suite d'événements deux à deux disjoints. Les événements sont eux aussi deux à deux disjoints, car pour . La -additivité de donne alors
l'interversion de la somme et de la division étant licite puisque est une constante strictement positive et que la série converge (ses sommes partielles sont majorées par ).
Les deux conséquences annoncées ne sont alors que la probabilité du complémentaire et la formule du crible à deux termes du chapitre 1, appliquées à .
On tire une carte d'un jeu de 52 cartes. Sachant que la carte tirée est une figure (valet, dame ou roi), quelle est la probabilité que ce soit un roi?
La formule des probabilités composées
De la définition à la règle de calcul
Lue de droite à gauche, la définition (2.1) devient une formule de calcul: au lieu de déduire la probabilité conditionnelle d'une probabilité jointe, on construit la probabilité jointe à partir de probabilités conditionnelles que le modèle nous donne directement. C'est ce sens de lecture qui est utile, car dans une expérience séquentielle les données naturelles sont précisément les probabilités de chaque étape sachant ce qui a précédé.
Démonstration. Remarquons d'abord que l'hypothèse a un sens: la suite est décroissante, donc pour tout , et tous les conditionnements écrits sont légitimes.
Procédons par récurrence sur . Pour , la définition (2.1) appliquée à sachant s'écrit , d'où .
Supposons la formule vraie au rang et posons , de probabilité strictement positive. Le cas appliqué à et donne , et l'hypothèse de récurrence développe en le produit des premiers facteurs. En les concaténant on obtient (2.2).
Une autre façon de voir (2.2): le produit est télescopique. Chaque facteur est un quotient , et tous les termes intermédiaires se simplifient. Cette lecture explique pourquoi l'ordre dans lequel on énumère les événements est libre: on peut conditionner dans l'ordre chronologique, mais aussi dans n'importe quel autre, et le produit vaut toujours .
Lire un arbre pondéré
La formule (2.2) se dessine. Un arbre pondéré représente une expérience séquentielle: chaque nœud est un état de connaissance, chaque branche porte la probabilité conditionnelle de l'étape sachant tout le chemin parcouru, et chaque feuille porte la probabilité de l'intersection correspondante. Les règles de lecture sont exactement les théorèmes de ce chapitre:
- on multiplie le long d'un chemin (formule des probabilités composées);
- on additionne les feuilles qui réalisent un même événement (additivité, puisque des chemins distincts correspondent à des événements disjoints);
- la somme des branches issues d'un même nœud vaut (c'est du théorème 2.1), et la somme de toutes les feuilles vaut .
Ces deux dernières égalités sont des vérifications gratuites: prenez l'habitude de les faire avant d'exploiter un arbre. Nous les vérifierons explicitement sur l'arbre du dépistage.
Une urne contient boules blanches et noires. On tire deux boules sans remise. Quelle est la probabilité que la deuxième soit noire sachant que la première l'était?
Système complet d'événements et probabilités totales
Découper l'univers
La plupart des situations réelles se présentent ainsi: l'événement qui nous intéresse peut survenir pour plusieurs raisons mutuellement exclusives, et l'on connaît sa probabilité sous chacune de ces raisons. Il faut alors recomposer le tout. Le découpage porte un nom.
Le système complet le plus simple est dès que . Le plus courant en pratique est la liste des «causes» possibles d'un phénomène: les trois machines d'un atelier, les quatre fournisseurs d'un composant, les deux états de santé d'un patient.
Démonstration. Puisque les recouvrent ,
par distributivité de l'intersection sur la réunion. Les événements sont deux à deux incompatibles, car pour . La -additivité de (axiome de Kolmogorov, chapitre 1) donne donc la première égalité de (2.3). La seconde s'obtient en appliquant à chaque terme la formule des probabilités composées, , légitime puisque .
La formule (2.3) est une moyenne pondérée: est la moyenne des probabilités conditionnelles , pondérée par les probabilités des blocs. Il en résulte un encadrement souvent utile:
Une probabilité globale ne peut donc jamais sortir de l'intervalle balayé par ses probabilités conditionnelles — un contrôle d'ordre de grandeur qui repère beaucoup d'erreurs de calcul.
Remettez dans l'ordre les étapes d'un calcul de probabilité a posteriori.
Glissez les éléments pour les mettre dans le bon ordre
- Écrire les vraisemblances: la probabilité de l'observation sachant chaque cause
- Diviser le produit (a priori × vraisemblance) de la cause visée par cette probabilité totale
- Écrire les probabilités a priori de chaque cause
- Calculer la probabilité de l'observation par la formule des probabilités totales
- Choisir un système complet d'événements (les causes possibles) et nommer l'événement observé
La formule de Bayes
Renverser un conditionnement
Nous savons calculer quand le modèle nous donne ; il reste à écrire la formule qui effectue ce renversement. Elle tient en une ligne, mais c'est probablement la ligne la plus lourde de conséquences de tout le cours.
Démonstration. La formule des probabilités composées, écrite dans les deux ordres possibles, donne
Comme , on peut diviser par les deux membres extrêmes, ce qui est (2.5). Pour (2.6), on applique (2.5) au couple : le numérateur est et le dénominateur , que la formule des probabilités totales (2.3) développe en la somme annoncée.
La démonstration est courte parce que Bayes n'ajoute rien: c'est la symétrie de combinée à une division. Sa portée vient de l'interprétation, qui mérite un vocabulaire propre.
Deux idées à retenir, et une à ne jamais oublier.
Bayes inverse un conditionnement. Il transforme «probabilité de l'observation sachant la cause» en «probabilité de la cause sachant l'observation». Or c'est presque toujours la première que la science ou la technique nous fournit (un laboratoire mesure la sensibilité d'un test sur des malades connus, un fabricant mesure le taux de panne d'un composant), et la seconde que nous voulons (ce patient est-il malade? ce composant est-il en cause?).
Bayes est une règle de mise à jour. La forme «posterior prior vraisemblance» montre que l'observation multiplie la croyance initiale par un facteur; la normalisation ne fait que ramener la somme à . Si l'on reçoit deux observations successives, on peut appliquer Bayes deux fois de suite, le posterior de la première servant de prior à la seconde; l'exercice 2.3 vérifie que le résultat est identique au calcul direct.
Le prior ne s'évapore jamais. Aussi convaincante que soit l'observation, elle ne dispense pas de connaître . Oublier le prior — traiter comme s'il valait — est l'erreur de raisonnement la plus coûteuse de la discipline. Elle a un nom et une section, plus bas.
L'exemple qui fait tout comprendre: le dépistage «Test D»
Nous utilisons ici un test de dépistage entièrement fictif, appelé Test D, pour une maladie elle aussi fictive. Les trois nombres qui le définissent sont ceux que tout le cours emploiera: aucun n'est emprunté à un test réel, et aucun ne doit être attribué à une institution ou à un laboratoire existant.
Étape 1 — poser le système complet. Les deux états de santé, et , forment un système complet d'événements: , , et .
Étape 2 — écrire les quatre probabilités conjointes. La formule des probabilités composées donne les quatre feuilles de l'arbre:
| Chemin | Calcul | Probabilité | Sur 10 000 personnes |
|---|---|---|---|
| (vrai positif) | 98 | ||
| (faux négatif) |
La somme des quatre vaut exactement: la vérification annoncée plus haut est faite.
Étape 3 — probabilités totales. L'événement «le test est positif» se décompose sur le système complet:
Près de des personnes dépistées seront déclarées positives, alors que seulement sont malades. Le déséquilibre est déjà visible: sur les , la part qui vient des bien-portants, , est cinq fois plus grosse que celle qui vient des malades.
Étape 4 — Bayes. La question du patient est: «je suis positif, quelle est la probabilité que je sois malade?» C'est , et non :
Cette quantité s'appelle la valeur prédictive positive du test. Autrement dit: un test positif laisse encore plus de cinq chances sur six d'être en bonne santé, avec un test dont la sensibilité et la spécificité sont pourtant excellentes.
Étape 5 — l'autre côté. La valeur prédictive négative se calcule de même:
Un test négatif, lui, est presque une certitude: , soit environ deux malades sur dix mille personnes déclarées négatives. Le test est donc excellent pour écarter la maladie et médiocre pour la confirmer. C'est la raison pour laquelle un dépistage de masse est toujours suivi d'un examen de confirmation.
Pourquoi: la prévalence commande tout
Rien dans le calcul ci-dessus ne dépend de la qualité du test seule. Réécrivons (2.8) avec une prévalence quelconque, une sensibilité et une spécificité :
Quand devient petit, le numérateur décroît proportionnellement à , tandis que le second terme du dénominateur tend vers la constante : le rapport tend vers . Le tableau suivant, calculé avec la même sensibilité et la même spécificité , montre le phénomène (toutes les valeurs sont recalculées, arrondies à la fin).
| Prévalence | Valeur prédictive positive | Vrais positifs (sur 1000) | Faux positifs (sur 1000) | |
|---|---|---|---|---|
Le nombre de faux positifs bouge à peine — il est gouverné par la spécificité appliquée à la population des bien-portants, qui reste presque toute la population. Le nombre de vrais positifs, lui, est directement proportionnel à la prévalence. La valeur prédictive positive n'est que le rapport des deux, et c'est donc la prévalence qui la pilote.
Test de dépistage fictif appliqué à 1000 personnes. La barre de gauche est à l'échelle de la population; celle de droite ne garde que les personnes déclarées positives et les renormalise, de sorte que sa partie VP, celle des vrais positifs, est exactement la valeur prédictive positive. Faites descendre la prévalence sans rien changer d'autre: la sensibilité et la spécificité ne bougent pas, et pourtant la valeur prédictive positive s'effondre.
Avec la même sensibilité de et la même spécificité de , quelle est la valeur prédictive positive si la prévalence vaut ? Donnez une probabilité entre 0 et 1.
L'erreur du procureur
Chiffrons l'erreur du procureur sur un cas fictif, construit de toutes pièces pour l'exposé. Une trace biologique est retrouvée sur une scène. Le laboratoire établit que la probabilité qu'une personne prise au hasard dans la population présente le même profil vaut , où est l'événement «le profil correspond» et «la personne est l'auteur». Un suspect est identifié et son profil correspond.
Le procureur conclut: «il y a une chance sur cent mille que ce soit un innocent». Il a remplacé par , ce que rien ne justifie. Faisons le calcul correct. Supposons que l'enquête n'ait, avant l'analyse, aucune raison de soupçonner ce suspect plutôt qu'une autre des personnes qui auraient pu matériellement commettre l'acte: le prior est . La vraisemblance sous est (l'auteur correspond certainement). Par les probabilités totales,
puis par Bayes
Environ , et non . La raison est la même que pour le dépistage: dans une population de personnes, on attend environ cinq personnes innocentes au profil correspondant, contre un seul coupable. La correspondance est une preuve, et une preuve forte — elle a multiplié la probabilité par un facteur environ — mais elle ne suffit pas à elle seule. Si l'enquête avait par ailleurs réduit le cercle des suspects à mille personnes, le prior aurait été et le posterior : le même indice, une conclusion opposée.
Un test de dépistage a une sensibilité de et une spécificité de . La maladie touche une personne sur dix mille. Quelle est approximativement la valeur prédictive positive?
L'indépendance
Deux événements
Conditionner change en général les probabilités. Le cas où cela ne change rien mérite un nom: c'est le cas où l'information apportée par est sans valeur pour prédire .
Cette définition est symétrique en et et ne suppose aucune probabilité strictement positive: c'est pour ces deux raisons qu'on la préfère à la formulation conditionnelle, à laquelle elle est pourtant équivalente dès que le conditionnement est licite.
Démonstration. 1. Si , la définition (2.1) donne . L'égalité (2.10) équivaut donc à , c'est-à-dire, après division par , à .
3. Supposons (2.10). Comme est une réunion disjointe,
donc . Par symétrie de (2.10) en ses deux arguments, on obtient , puis en appliquant une seconde fois le raisonnement, .
2. Si , les deux conditionnements sont définis. Si , le point 1 donne et le point 3 suivi du point 1 donne : les deux sont égaux. Réciproquement, si , la formule des probabilités totales (2.4) donne , donc et l'on conclut par le point 1.
Le point 2 est la lecture la plus parlante: et sont indépendants exactement lorsque savoir si s'est produit ou non ne modifie pas la probabilité de . Le point 3 est indispensable en pratique — c'est lui qui autorise, dans les calculs de fiabilité, à passer de «les composants fonctionnent indépendamment» à «les composants tombent en panne indépendamment».
Soient et deux événements avec et . Laquelle de ces affirmations est nécessairement fausse?
Indépendance mutuelle de événements
Pour plus de deux événements, la bonne définition n'est pas celle qu'on écrirait spontanément.
Pour événements, la définition impose égalités: pour , ce sont les trois égalités deux à deux plus l'égalité triple, soit quatre conditions. L'indépendance mutuelle entraîne évidemment l'indépendance deux à deux. La réciproque est fausse, et le contre-exemple suivant, dû à Sergueï Bernstein, est le plus économique qui soit.
Indépendance conditionnelle
Un conditionnement peut créer une dépendance là où il n'y en avait pas, ou détruire une dépendance existante. Il faut donc un troisième concept.
C'est simplement l'indépendance au sens de (2.10), mais pour la probabilité du théorème 2.1 — une nouvelle illustration de ce que ce théorème fait gagner. L'indépendance conditionnelle n'entraîne pas l'indépendance, et l'indépendance n'entraîne pas l'indépendance conditionnelle. Les deux exemples suivants le montrent, chacun dans un sens.
Trois applications numériques
Fiabilité d'un système en série et en parallèle
Un système est constitué de composants dont on suppose les fonctionnements mutuellement indépendants. On note la fiabilité du composant , c'est-à-dire la probabilité qu'il fonctionne pendant la mission considérée, et celle du système.
Montage en série. Le système fonctionne si et seulement si tous les composants fonctionnent. Par indépendance mutuelle,
Montage en parallèle. Le système fonctionne si au moins un composant fonctionne. On passe au complémentaire — le système tombe en panne si tous les composants tombent en panne — et le point 3 du théorème 2.5, étendu à événements, autorise à multiplier les :
Deux conséquences se lisent directement sur les formules. En série, la fiabilité est inférieure à celle du plus faible composant: une chaîne de composants à ne vaut plus que . En parallèle, au contraire, la fiabilité est supérieure à celle du meilleur composant, et la probabilité de panne décroît géométriquement: avec des composants à , il suffit de cinq branches en parallèle pour atteindre .
Trois composants indépendants de fiabilité chacun sont montés en parallèle. Quelle est la fiabilité du système?
Un contrôle industriel à deux étages
Une ligne de production fabrique des pièces dont une proportion est défectueuse (données fictives). Chaque pièce passe deux contrôles successifs, conçus pour être indépendants conditionnellement à l'état de la pièce. Le premier contrôle rejette une pièce défectueuse avec probabilité , le second avec probabilité . Chaque contrôle rejette aussi à tort une pièce conforme avec probabilité (fausse alarme). Une pièce est acceptée si elle passe les deux contrôles.
Vraisemblances. Conditionnellement à l'état de la pièce, les deux contrôles sont indépendants, donc
Probabilités totales.
Bayes, deux fois. La qualité de la production livrée est
soit environ pièces défectueuses par million livrées, contre par million à l'entrée: les deux étages ont divisé le taux de défauts par . Mais regardons aussi le rebut. La probabilité de rejeter une pièce est , soit de la production, et
Plus de la moitié des pièces rejetées sont conformes. C'est la structure du Test D transposée à l'atelier: les pièces conformes sont fois plus nombreuses que les défectueuses, et il suffit d'un petit taux de fausse alarme pour qu'elles dominent le rebut. Le coût du contrôle n'est pas seulement celui des appareils: c'est aussi celui des bonnes pièces jetées, et l'arbitrage entre les deux se décide sur ces deux probabilités a posteriori, pas sur les taux de détection annoncés par le fournisseur des appareils.
Le problème de Monty Hall
Voici le problème le plus discuté de la théorie des probabilités élémentaire. Un candidat fait face à trois portes. Derrière l'une d'elles se trouve une voiture, derrière les deux autres une chèvre. Le candidat désigne une porte, disons la porte 1. Le présentateur, qui sait où est la voiture, ouvre alors une autre porte, disons la porte 3, découvrant une chèvre. Il propose au candidat de changer son choix pour la porte 2. Le candidat a-t-il intérêt à changer?
Ici, poser les hypothèses est le travail mathématique. Le problème n'a pas de réponse tant que le comportement du présentateur n'est pas spécifié; c'est la source de tous les désaccords qu'il a provoqués. Posons donc:
- (H1) La voiture est placée derrière l'une des trois portes, chacune avec la probabilité , indépendamment du choix du candidat.
- (H2) Le présentateur sait où se trouve la voiture.
- (H3) Il ouvre toujours une porte, jamais celle choisie par le candidat, et toujours une porte cachant une chèvre.
- (H4) Lorsqu'il a le choix entre deux portes — c'est-à-dire lorsque le candidat a désigné la bonne porte — il en ouvre une au hasard, chacune avec la probabilité .
Notons l'événement «la voiture est derrière la porte » et l'événement «le présentateur ouvre la porte 3», le candidat ayant choisi la porte 1. Les forment un système complet: par (H1).
Vraisemblances, données par (H3) et (H4):
La première vient de (H4): si la voiture est derrière la porte 1, les portes 2 et 3 cachent toutes deux une chèvre et le présentateur tire au sort. La deuxième: si la voiture est derrière la porte 2, la seule porte qu'il peut ouvrir est la 3. La troisième: il n'ouvre jamais la porte qui cache la voiture.
Probabilités totales:
Bayes:
Le candidat qui garde la porte 1 gagne avec probabilité ; celui qui change pour la porte 2 gagne avec probabilité . Il faut donc changer: la stratégie double les chances.
Où est l'intuition? Dans le fait que l'ouverture de la porte 3 n'apporte aucune information sur la porte 1 — le présentateur allait de toute façon ouvrir une porte à chèvre, quelle que soit la position de la voiture, et ne dépend pas de — alors qu'elle en apporte sur la porte 2. La probabilité de la porte 1 est figée au moment du choix initial, et les restants, initialement répartis sur les portes 2 et 3, se concentrent tout entiers sur la porte 2. Le jeu avec dix portes rend cela évident: vous en choisissez une (probabilité ), le présentateur ouvre huit portes à chèvre, et la seule porte restante porte les .
Synthèse
- Conditionner, c'est renormaliser. pour ; l'application est une probabilité au sens de Kolmogorov (théorème 2.1), de sorte que tous les résultats du chapitre 1 s'y transportent sans nouvelle démonstration.
Pour que soit définie, il faut et il suffit que:
Un service de messagerie (données fictives) reçoit de courriels indésirables. Le mot «gratuit» apparaît dans des courriels indésirables et dans des courriels légitimes. Un courriel arrive, contenant le mot «gratuit». On note l'événement «le courriel est indésirable» et l'événement «le courriel contient le mot». Il s'agit de calculer , puis d'examiner ce que change l'arrivée d'un second indice.
Identifier le système complet et les vraisemblances
Les deux états possibles du courriel, indésirable ou légitime, forment un système complet d'événements.
Parmi ces quatre nombres, lequel est la probabilité a priori de ?
Probabilité de l'observation
Probabilité a posteriori
Ce que change l'absence du mot
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
- On lance deux dés équilibrés discernables. Calculer et . Commenter l'écart.
Une entreprise de transport (données fictives) exploite trois types de véhicules: de type , de type et de type . La probabilité qu'un véhicule subisse au moins une panne dans l'année vaut pour , pour et pour .
On reprend le Test D fictif du cours: , sensibilité , spécificité . Une personne dépistée positive est soumise une seconde fois au même test, dont on suppose les deux applications indépendantes conditionnellement à l'état de santé.
- Calculer et , puis .
- Soient et indépendants avec et . Calculer , et .
Un système de commande comporte un capteur, une unité de calcul et un actionneur, montés en série, de fiabilités respectives , et sur la durée d'une mission. Les trois composants sont supposés indépendants.
- Calculer la fiabilité du système et sa probabilité de défaillance.
- On double l'actionneur, le plus faible des trois: deux actionneurs identiques en parallèle, indépendants. Calculer la nouvelle fiabilité et le gain.
- Combien d'actionneurs en parallèle faudrait-il pour que le sous-système actionneur atteigne une fiabilité d'au moins ?
- On apprend que les deux actionneurs du point 2 partagent la même alimentation, laquelle tombe en panne avec probabilité ; conditionnellement au bon fonctionnement de l'alimentation, les actionneurs restent indépendants avec fiabilité , et si l'alimentation tombe en panne, aucun ne fonctionne. Recalculer la fiabilité du sous-système actionneur et commenter.
Références
- Ross, S. M., Initiation aux probabilités, Presses polytechniques et universitaires romandes, Lausanne — chapitre 3 (probabilité conditionnelle et indépendance), avec de nombreux exemples de dépistage.
- Saporta, G., Probabilités, analyse des données et statistique, Technip, Paris — chapitre 2 pour la formule de Bayes et le vocabulaire a priori / a posteriori.
- Morgenthaler, S., Introduction à la statistique, Presses polytechniques et universitaires romandes, Lausanne — conditionnement et indépendance dans un cadre d'ingénieur.
- Dodge, Y., Statistique — dictionnaire encyclopédique, Springer, Paris — entrées «probabilité conditionnelle», «théorème de Bayes», «sensibilité et spécificité».
- Wackerly, D., Mendenhall, W. et Scheaffer, R., Mathematical Statistics with Applications, Cengage, Boston — chapitre 2, en particulier les exercices sur la fiabilité des systèmes.
- Rice, J. A., Mathematical Statistics and Data Analysis, Duxbury, Belmont — chapitre 1, pour le problème de Monty Hall traité par conditionnement explicite.