Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
- décrire un couple de variables aléatoires par sa loi conjointe — tableau de contingence dans le cas discret, densité dans le cas continu — et en extraire les lois marginales et les lois conditionnelles;
- reconnaître l'indépendance de deux variables aléatoires, sur un tableau comme sur une densité, et dire précisément ce qu'elle autorise;
- calculer , la covariance et la corrélation , et utiliser la bilinéarité de la covariance;
- établir et appliquer , puis sa généralisation à variables;
Ce chapitre est la charnière du cours. Jusqu'ici, une variable aléatoire vivait seule: le chapitre 3 lui a donné une loi, une espérance et une variance, les chapitres 4 et 6 lui ont donné des lois usuelles. Mais la statistique ne travaille jamais sur une seule observation: elle travaille sur un échantillon , c'est-à-dire sur variables aléatoires à la fois. Tout ce que les chapitres 8 à 12 feront — loi des grands nombres, théorème central limite, estimation, intervalles de confiance, tests — repose sur trois résultats qui n'ont de sens que pour plusieurs variables: la définition de l'indépendance d'un échantillon, l'additivité de la variance , et la loi d'une somme. Ce chapitre les démontre.
Sauf mention contraire, toutes les données chiffrées de ce chapitre sont fictives et servent uniquement à l'exposé.
Couple de variables aléatoires discrètes
Loi conjointe
Deux variables aléatoires définies sur le même univers peuvent être observées simultanément: à chaque issue correspond le couple . C'est cette observation simultanée qui est l'objet du chapitre. Le mot «même univers» n'est pas décoratif: comparer la taille d'un individu et le poids d'un autre n'aurait aucun sens.
La relation (7.2) n'est que l'axiome de normalisation appliqué à la partition de par les événements : ces événements sont deux à deux disjoints et leur réunion est tout entier. C'est le contrôle à faire sur tout tableau de loi conjointe, et nous le referons à chaque exemple.
Lorsque et sont petits, la loi conjointe s'écrit naturellement comme un tableau de contingence: une ligne par valeur de , une colonne par valeur de , et dans chaque case la probabilité .
Lois marginales
Les deux dernières bandes du tableau portent un nom.
Démonstration. Les événements , pour parcourant , forment une partition de (ils sont disjoints et leur réunion est puisque prend toujours une valeur). La formule des probabilités totales du chapitre 2, appliquée à l'événement et à cette partition, donne
ce qui est la première égalité de (7.3); la seconde s'obtient en échangeant les rôles.
Le vocabulaire vient précisément de la disposition du tableau: on écrit ces sommes dans la marge. Retenez le sens de la flèche: la loi conjointe détermine les deux lois marginales, mais les deux lois marginales ne déterminent pas la loi conjointe. Deux tableaux différents peuvent avoir exactement les mêmes marges — nous en verrons un à l'exemple 7.2. L'information perdue en passant au tableau des marges est précisément l'information sur le lien entre et , qui est le sujet de tout ce chapitre.
Lois conditionnelles
Ce n'est rien d'autre que la probabilité conditionnelle du chapitre 2, , avec et . C'est bien une loi de probabilité: ses termes sont positifs et leur somme vaut, par (7.3),
Sur le tableau, la recette est d'une simplicité qu'il faut garder en tête: une loi conditionnelle est une colonne (ou une ligne) divisée par sa propre marge. Reprenons l'exemple 7.1. La colonne contient , , , de marge . En divisant,
de somme . On voit immédiatement ce que la marge de ne disait pas: sachant qu'un client prend deux billets supplémentaires, la probabilité qu'il enregistre deux bagages passe de à . Les deux variables ne sont donc pas sans lien. Pour comparaison, les deux autres colonnes donnent
Trois colonnes, trois lois conditionnelles différentes: le profil des bagages change avec le nombre de billets. Nous verrons au paragraphe suivant que cette variation est exactement la négation de l'indépendance.
Dans le tableau de l'exemple 7.1, que vaut ?
Indépendance de deux variables aléatoires
Définition et critère
Le contenu intuitif est celui du chapitre 2: connaître ne change rien à ce que l'on sait de . Cela se lit directement sur les lois conditionnelles. En effet, si (7.5) est vraie et si , alors
c'est-à-dire: toutes les lois conditionnelles de sont égales à la loi marginale de . Réciproquement, si toutes les lois conditionnelles coïncident avec la marginale, (7.5) se retrouve en multipliant par . Retenez donc la caractérisation, souvent la plus commode à vérifier:
Lire l'indépendance sur un tableau
Sur un tableau de contingence, (7.5) dit que chaque case est le produit de sa marge de ligne par sa marge de colonne. Il existe une lecture encore plus rapide, purement visuelle.
Un tableau de contingence a pour colonnes et . Les deux variables sont-elles indépendantes?
Couple de variables aléatoires continues
Densité conjointe
Le passage au continu suit exactement le schéma du chapitre 5: la somme devient une intégrale, et la loi est portée par une densité — ici une densité de deux variables, dont les intégrales doubles sont celles du chapitre 9 d'Analyse II.
Comme dans le cas d'une variable, n'est pas une probabilité: c'est une probabilité par unité d'aire, et pour tout couple . La probabilité est un sous la surface , au-dessus du domaine .
Démonstration. 1. Prenons dans (7.8):
où l'interversion de l'ordre d'intégration est licite pour une fonction positive intégrable (théorème de Fubini–Tonelli, chapitre 9 d'Analyse II). La fonction de répartition de est donc l'intégrale de la fonction entre parenthèses, qui est par définition la densité de .
-
Si (7.10) a lieu, alors pour l'intégrale double se factorise en un produit de deux intégrales simples, ce qui donne , soit (7.6). Réciproquement, si , la dérivation par rapport à puis à donne aux points de continuité.
Pour le couple de l'exemple 7.3, calculez .
Espérance d'une fonction du couple
On sait calculer depuis le chapitre 3, sans passer par la loi de . Le même théorème de transfert vaut pour un couple.
Nous l'admettons: la démonstration dans le cas discret consiste à regrouper les couples selon la valeur de et à utiliser l'associativité des familles sommables; dans le cas continu, elle demande la théorie de la mesure, qui n'est pas un prérequis de ce cours. Les deux conséquences suivantes, en revanche, se démontrent en trois lignes et sont utilisées partout.
Démonstration (cas discret; le cas continu est identique avec des intégrales). Appliquons (7.13) à :
Par (7.3), la première somme intérieure vaut et la deuxième ; par (7.2), la troisième vaut . On obtient . Le cas de variables s'en déduit par récurrence.
Cette propriété est d'un usage constant et mérite d'être soulignée: l'espérance d'une somme est toujours la somme des espérances, que les variables soient indépendantes ou non, corrélées ou non. Nous verrons dans un instant que la variance, elle, n'a pas cette générosité.
Démonstration (cas discret). Par (7.13) avec , puis par (7.5):
La factorisation de la double somme est légitime car la famille est sommable (produit de deux familles sommables). Dans le cas continu, on remplace (7.5) par (7.10) et les sommes par des intégrales, et le théorème de Fubini permet la même factorisation.
Covariance
Définition et formule de calcul
La linéarité de l'espérance ne dit rien du lien entre et . La covariance est l'indicateur qui le mesure, à l'ordre deux.
L'idée est directe. Le produit est positif lorsque les deux variables s'écartent de leur moyenne dans le même sens (toutes deux au-dessus, ou toutes deux en dessous) et négatif lorsqu'elles s'en écartent en sens contraires. La covariance est la moyenne de ce produit: elle est positive si le lien est «croissant», négative s'il est «décroissant», nulle si les deux configurations se compensent. Son unité est le produit des unités de et de : une covariance entre une taille en mètres et un poids en kilogrammes s'exprime en , ce qui rend son ampleur difficile à interpréter — d'où la corrélation, plus loin.
Démonstration. Développons le produit dans (7.17) et utilisons la linéarité de l'espérance (théorème 7.4), en n'oubliant pas que et sont des constantes:
C'est exactement la formule du chapitre 3, dont elle est la généralisation: en faisant dans (7.18), on retrouve
La variance est la covariance d'une variable avec elle-même. Cette identité est le fil conducteur de tout ce qui suit.
Bilinéarité
Démonstration. 1 et 5 sont immédiats sur (7.17) et (7.19). Pour 3, la variable a pour espérance , donc : l'écart à la moyenne est inchangé, et (7.17) aussi. Pour 4, . Pour 2, posons , d'espérance par linéarité; alors , et
par linéarité de l'espérance.
Ces propriétés font de la covariance un produit scalaire sur l'espace des variables centrées de carré intégrable: symétrique, bilinéaire, positif. C'est le point de vue qui explique tout le reste du chapitre — la variance est le carré d'une norme, l'écart-type est cette norme, et l'inégalité sera l'inégalité de Cauchy–Schwarz.
Variance d'une somme
Démonstration. Par (7.19) puis par bilinéarité (théorème 7.7):
et la symétrie regroupe les deux termes croisés, ce qui donne (7.20). Pour variables, le même développement donne
somme de termes. Les termes diagonaux () valent ; les autres se groupent deux par deux par symétrie, d'où (7.21).
En remplaçant par (dont la covariance avec change de signe par bilinéarité), on obtient de même
Et de façon générale, pour des coefficients et :
Indépendance et covariance nulle
Démonstration. Par le théorème 7.5, l'indépendance donne ; la formule (7.18) donne alors . Si les sont indépendantes, elles le sont deux à deux, donc toutes les covariances croisées de (7.21) sont nulles et il ne reste que la diagonale.
La relation (7.24) est le résultat que ce chapitre devait aux suivants. C'est elle qui donne, pour un échantillon de variables indépendantes de même loi, de moyenne et de variance :
La fameuse décroissance en de l'erreur d'échantillonnage — celle qui impose de quadrupler la taille d'un sondage pour diviser sa marge par deux — n'a pas d'autre origine que (7.24). Les chapitres 8, 11 et 12 s'en serviront à chaque page.
Toujours pour l'exemple 7.1, avec , et , calculez la corrélation .
Corrélation
Définition et inégalité fondamentale
La covariance a le défaut d'avoir une unité, donc de changer de valeur quand on change d'unité: mesurer une longueur en centimètres plutôt qu'en mètres multiplie la covariance par , alors que le lien entre les deux variables n'a évidemment pas changé. On la normalise.
C'est un nombre sans unité. Il est invariant par tout changement d'échelle affine croissant: pour et ,
en utilisant la bilinéarité et ; si et sont de signes contraires, change de signe. Autrement dit, ne dépend ni des unités ni de l'origine choisies.
Démonstration. Posons et , et considérons, pour , la fonction
où la dernière égalité est (7.23). Comme est l'espérance d'une quantité positive, on a pour tout . C'est donc un trinôme du second degré en , de coefficient dominant , qui ne prend jamais de valeur strictement négative: son discriminant est nécessairement négatif ou nul,
ce qui est exactement , soit (7.27) après extraction de la racine carrée.
Cas d'égalité. On a si et seulement si , c'est-à-dire si et seulement si le trinôme possède une racine double . Alors . Or une variable aléatoire de variance nulle est presque sûrement égale à son espérance (chapitre 3): presque sûrement, d'où , relation affine avec , du signe de la covariance donc de . Réciproquement, si avec , la bilinéarité donne et , donc .
Cette démonstration mérite d'être relue: c'est l'inégalité de Cauchy–Schwarz de l'algèbre linéaire, appliquée au produit scalaire sur les variables centrées. Le cas d'égalité de Cauchy–Schwarz — les deux vecteurs sont colinéaires — devient ici: et sont liées par une relation affine exacte. Et l'interprétation de en découle:
- : les points sont exactement sur une droite de pente positive;
- : exactement sur une droite de pente négative;
- proche de : le nuage est concentré autour d'une droite;
- : aucune tendance linéaire — ce qui, nous l'avons vu, n'exclut aucunement un lien.
Corrélation et causalité
Une corrélation forte entre deux variables autorise à prédire l'une par l'autre; elle n'autorise pas à dire que l'une cause l'autre. Trois mécanismes distincts produisent la même valeur de , et rien dans le nombre ne permet de les distinguer.
Le premier est la cause commune. Le nombre de coups de soleil et la consommation de glaces sont corrélés dans une population; aucun des deux ne cause l'autre, une troisième variable — la température — les commande tous deux. C'est le cas le plus fréquent en pratique et le plus difficile à écarter, car la variable de confusion est souvent non mesurée. Le second est l'inversion du sens: on observe que les entreprises très rentables investissent davantage en recherche, et l'on conclut que la recherche rend rentable; le lien pourrait aussi bien aller de la rentabilité vers la capacité à financer la recherche, ou, plus probablement, dans les deux sens. Le troisième est la sélection: si l'on n'observe qu'une partie de la population, choisie selon un critère qui dépend des deux variables, une corrélation peut apparaître, ou disparaître, dans l'échantillon sans exister dans la population.
Il existe même des corrélations sans aucun mécanisme: entre deux séries temporelles toutes deux croissantes, est proche de par construction, quelle que soit leur nature, et l'on peut fabriquer par recherche systématique des paires absurdes à . Ce n'est pas une curiosité: c'est la conséquence arithmétique du fait que deux tendances monotones de même sens sont linéairement liées.
Ce que l'on peut faire, honnêtement, avec une corrélation observée: la signaler, l'assortir de son ordre de grandeur, et énoncer les hypothèses causales concurrentes. Ce que l'on ne peut pas faire: trancher entre elles sans une information supplémentaire — une expérimentation avec assignation aléatoire, une variable instrumentale, une discontinuité de la règle d'attribution, ou une théorie du mécanisme testée par ailleurs. La formule ne contient aucune information sur la direction du temps ni sur celle de l'action; il serait étonnant qu'elle puisse en produire.
Un échantillon fictif de 150 couples, tiré une fois pour toutes par un générateur ensemencé, puis orthonormalisé: X et Y ont une variance empirique exactement égale à 1 et une covariance empirique exactement égale à ρ, quel que soit ρ. Faites glisser ρ: le nuage s'aplatit sur une droite, mais les deux barres grises ne bougent pas d'un pixel. Seule Var(X + Y) = Var(X) + Var(Y) + 2 Cov(X, Y) se déplace, de 0,1 à 3,9.
Dans l'explorateur ci-dessus, faites glisser de à et surveillez les trois barres. Les deux premières, et , ne bougent pas d'un pixel: les lois marginales sont les mêmes pour toutes les valeurs de . Seule la troisième se déplace, de à , c'est-à-dire d'un facteur . C'est l'illustration exacte de (7.20): ; il y faut la covariance, et elle seule.
Deux variables vérifient , et . Que vaut ?
Remettez dans l'ordre les étapes du calcul de à partir d'un tableau de contingence.
Glissez les éléments pour les mettre dans le bon ordre
- Sommer chaque colonne et chaque ligne pour obtenir les lois marginales de et de
- Calculer , , , sur les marges, puis et
- En déduire
- Vérifier que la somme de toutes les cases du tableau vaut 1
- Diviser par et contrôler que le résultat est bien entre et
- Calculer sur les cases du tableau
Espérance conditionnelle
Définition
La loi conditionnelle de sachant est une loi de probabilité: elle possède donc une espérance.
Deux objets distincts portent donc presque le même nom, et il faut absolument les séparer: est un nombre, qui dépend de ; est une variable aléatoire, fonction de . La seconde est la meilleure prévision de que l'on puisse faire en ne connaissant que , au sens de l'erreur quadratique moyenne: parmi toutes les fonctions , c'est qui minimise . Nous ne démontrerons pas ce résultat, qui n'est utilisé nulle part dans la suite du cours; retenez-en l'idée, car c'est elle qui justifie le nom de «prévision».
Sur l'exemple 7.1, les trois lois conditionnelles calculées plus haut donnent
La fonction est donc croissante, de à : le nombre moyen de bagages augmente avec le nombre de billets. C'est la même information que la covariance positive de l'exemple 7.4, sous une forme plus riche — la covariance résume cette fonction par un seul nombre.
Formule de l'espérance totale
Démonstration (cas discret). La variable est une fonction de ; son espérance se calcule par le théorème de transfert du chapitre 3, puis on remplace par sa définition (7.28):
Il reste à intervertir les deux sommes (licite, la famille étant sommable puisque admet une espérance) et à utiliser (7.3):
Cette formule est l'analogue, pour les espérances, de la formule des probabilités totales du chapitre 2 — dont elle est d'ailleurs le cas particulier obtenu avec . Contrôlons-la sur l'exemple 7.1:
L'intérêt pratique de (7.30) est considérable: elle permet de calculer une espérance en deux temps, en conditionnant par la première étape d'une expérience aléatoire. C'est presque toujours plus simple que d'établir la loi complète.
Une caisse fictive reçoit clients par heure, avec . Chaque client achète, indépendamment des autres, un article avec probabilité . Quel est le nombre moyen d'articles vendus en une heure?
Somme de variables aléatoires indépendantes
La convolution
Connaître et ne donne pas la loi de . Lorsque les deux variables sont indépendantes, celle-ci se calcule par une opération d'un seul type.
Démonstration. 1. L'événement est la réunion disjointe, sur les valeurs possibles de , des événements . Par additivité puis par indépendance (7.5),
- Calculons la fonction de répartition de en intégrant la densité conjointe sur le demi-plan , puis en posant le changement de variable à fixé:
après interversion (Fubini–Tonelli, chapitre 9 d'Analyse II). La fonction entre parenthèses est donc la densité de .
La lecture de (7.31) est simple et vaut d'être dite en mots: pour obtenir , on énumère toutes les façons d'écrire comme somme d'une valeur de et d'une valeur de , et l'on additionne les produits de probabilités. Le mot «convolution» ne recouvre rien de plus.
Trois lois stables par addition
Certaines familles de lois sont stables: la somme de deux membres indépendants de la famille reste dans la famille. C'est un luxe, et il n'y en a pas beaucoup.
Démonstration. Deux voies. La plus courte est l'interprétation: compte les succès de épreuves de Bernoulli indépendantes de paramètre , ceux de autres, indépendantes des premières; la réunion forme épreuves indépendantes de même paramètre, dont compte les succès.
La voie calculatoire passe par (7.31). Pour :
puisque les puissances de et de ne dépendent pas de . Il reste l'identité de Vandermonde, , qui se démontre par un décompte direct sur les combinaisons du chapitre 1: choisir objets parmi répartis en deux paquets de tailles et , c'est en choisir dans le premier et dans le second, pour un quelconque, et les cas ainsi obtenus sont deux à deux disjoints. D'où le résultat.
Le fait que doive être commun n'est pas une coquetterie: la somme d'une et d'une indépendantes n'est pas binomiale. Ses valeurs vont de à , donc la seule binomiale envisageable serait une ; l'espérance imposerait , donc une variance de . Or, par (7.24), . Contradiction: n'est pas binomiale.
Démonstration. Par (7.31), pour :
La somme est, par la formule du binôme de Newton, égale à . Donc
qui est la loi .
Le résultat est intuitif si l'on pense au processus de Poisson: superposer deux flux d'arrivées indépendants, l'un à par minute et l'autre à , produit un flux à . Contrôle par les moments: des deux côtés, cohérent avec les théorèmes 7.4 et 7.9.
Ce théorème est admis. Les paramètres, eux, ne le sont pas: l'espérance vient du théorème 7.4 et la variance de (7.24), qui sont démontrés. Ce qui est admis est le fait que la loi de la somme est encore normale. La démonstration usuelle utilise la fonction caractéristique , qui transforme une convolution en produit et vaut pour une ; le produit de deux telles expressions est de la même forme, avec les paramètres additionnés, et un théorème d'injectivité permet de conclure. Cet outil n'est pas au programme de ce cours. Une démonstration directe par (7.32) est possible mais laborieuse: elle consiste à écrire l'intégrale du produit des deux densités gaussiennes, à compléter le carré dans l'exposant en et à reconnaître une intégrale gaussienne; nous n'en aurons pas besoin.
La stabilité de la loi normale est la raison pour laquelle elle est partout. Elle donne immédiatement, pour un échantillon indépendant de loi :
Ces trois relations, que les chapitres 11 et 12 utiliseront à chaque intervalle de confiance et à chaque test, sont exactes — et non approchées comme celles que donnera le théorème central limite du chapitre 8 pour une loi quelconque.
Le vecteur gaussien et la loi normale bivariée
Densité
On montre (calcul admis, de même nature que celui de la normalisation de la gaussienne au chapitre 6) que les marginales sont et , et que le paramètre est bien la corrélation . Le nuage de l'explorateur ci-dessus est un échantillon de cette loi, avec et .
Courbes de niveau. La densité (7.37) ne dépend du point que par la forme quadratique . Ses courbes de niveau sont donc les courbes , c'est-à-dire des centrées en — la forme quadratique est définie positive dès que , puisque son discriminant vaut . Leurs axes sont les directions propres de la matrice , soit les bissectrices et , de valeurs propres et . Concrètement:
- si , les ellipses sont des cercles (dans les variables réduites , );
- si , elles s'allongent le long de la première bissectrice, d'autant plus que approche ;
- si , elles s'allongent le long de la seconde;
- quand , l'ellipse dégénère en un segment: le couple se concentre sur une droite, ce qui est exactement le cas d'égalité du théorème 7.10.
Le cas où covariance nulle signifie indépendance
Démonstration. L'implication de droite à gauche est le théorème 7.9, valable pour tout couple. Pour l'autre, il suffit de poser dans (7.37):
et le critère (7.10) du théorème 7.2 conclut.
C'est une exception, et il faut la retenir comme telle: dans le monde gaussien, et seulement là, la covariance capture toute la dépendance. La raison profonde est que la densité (7.37) est entièrement déterminée par ses moments d'ordre et ; il n'y a rien d'autre à annuler.
Application: un portefeuille de deux actifs corrélés
Voici, chiffres à l'appui, ce que la covariance fait gagner. Un investisseur fictif répartit son capital entre deux actifs dont les rendements annuels et ont pour caractéristiques (données fictives):
Il place une fraction de son capital en et en . Le rendement du portefeuille est . Par linéarité (théorème 7.4), son espérance ne dépend de la corrélation:
Par (7.23), sa variance en dépend au contraire pleinement:
Le portefeuille équipondéré. Prenons . Le rendement espéré vaut quoi qu'il arrive, et
Lisez cette ligne d'écarts-types: pour le même rendement espéré de , le risque va de à selon la seule valeur de , soit un facteur . Les deux extrêmes se contrôlent à la main: si , la relation entre et est affine croissante (théorème 7.10) et , la moyenne des risques — aucune diversification; si , elle est affine décroissante et . Le cas donne , déjà bien en dessous de la moyenne :
Le portefeuille de variance minimale. On peut faire mieux en choisissant . En dérivant (7.39) par rapport à et en annulant, on trouve
Pour : , soit en ; la variance vaut alors et . Ce nombre mérite qu'on s'y arrête: Mélanger un actif risqué à un actif moins risqué non corrélé réduit le risque en dessous de celui du plus sûr — un résultat contre-intuitif qui est entièrement contenu dans (7.39). Le rendement espéré correspondant est .
Pour : , la variance tombe à , soit , pour un rendement espéré de — mieux que le portefeuille équipondéré sur les deux tableaux.
La même arithmétique pour deux erreurs de mesure. Le calcul est identique si et sont les erreurs de deux capteurs dont on moyenne les indications: la moyenne de deux mesures d'écarts-types et a l'écart-type donné par le tableau ci-dessus. Deux capteurs valent mieux que deux capteurs corrélés — et deux capteurs identiques branchés sur la même alimentation défaillante ( proche de ) n'apportent presque rien. C'est le même théorème, appliqué à un problème de métrologie plutôt qu'à un problème de finance.
Synthèse
- La loi conjointe d'un couple discret est un tableau dont la somme des cases vaut ; ses marges sont les lois de et de , et une loi conditionnelle est une colonne (ou une ligne) divisée par sa propre marge. Les marges ne déterminent pas la loi conjointe: toute l'information sur le lien est perdue en passant aux marges.
- et sont indépendantes si pour tout — sur un tableau: colonnes proportionnelles; dans le cas continu: , ce qui force un support rectangulaire.
Un couple vérifie , et . Que vaut ?
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Un péage fictif enregistre, pour chaque véhicule, le nombre d'occupants (, ou ) et l'indicateur valant si le véhicule est équipé d'un badge de télépéage, sinon. La loi conjointe, en cinquantièmes, est:
Soit le couple de densité conjointe sur et ailleurs.
Soient , , de carré intégrable, avec , , , , et .
- Soient et indépendantes, uniformes sur . Déterminer la loi de , son espérance et sa variance.
- Soient et indépendantes. Que vaut ?
Soit et soit une variable indépendante de , valant ou avec probabilité chacune. On pose .
Références
- Ross, S., Initiation aux probabilités, Presses polytechniques et universitaires romandes, Lausanne (chapitres sur les variables aléatoires conjointes et les espérances conditionnelles).
- Wackerly, D., Mendenhall, W. et Scheaffer, R., Mathematical Statistics with Applications, Cengage, Boston (chapitre «Multivariate Probability Distributions»).
- Saporta, G., Probabilités, analyse des données et statistique, Technip, Paris.
- Morgenthaler, S., Introduction à la statistique, Presses polytechniques et universitaires romandes, Lausanne.
- Rice, J. A., Mathematical Statistics and Data Analysis, Duxbury, Belmont (chapitres 3 à 4, couples de variables et covariance).
- Dodge, Y., Statistique — dictionnaire encyclopédique, Springer, Paris (entrées «covariance», «corrélation», «loi normale bivariée»).