Suites et séries géométriques, logarithmes et exponentielle, espérance, variance, covariance et corrélation, régression linéaire.
Ce cours emprunte à deux disciplines voisines un petit nombre d'outils, toujours les mêmes. À l'analyse, il prend la série géométrique, qui fait toute la valeur temps de l'argent — annuités, perpétuités, modèle de Gordon-Shapiro —, et le couple logarithme-exponentielle, qui mesure les durées et les taux continus. À la statistique, il prend l'espérance, la variance et la covariance, sur lesquelles reposent le risque et la diversification, puis leurs estimations sur un échantillon, et enfin la régression linéaire qui sert à estimer un bêta. Cette annexe rassemble ces outils, sans rien ajouter à ce dont les chapitres ont besoin.
Une annexe se consulte plus qu'elle ne se lit. Les démonstrations sont données lorsqu'elles sont courtes et qu'elles apprennent quelque chose — celle de la somme géométrique tient en deux lignes, celle du n−1 de la variance d'échantillon en quatre, celle de l'erreur type d'une pente de régression en une demi-page. Elles sont admises, avec la raison, lorsqu'elles relèvent franchement d'un cours de probabilités: c'est le cas de la loi de Student. Les renvois vont dans les deux sens: chaque chapitre qui s'appuie sur un résultat d'ici le cite, et le tableau ci-dessous dit où chaque résultat sert.
Chapitre
Ce qu'il emprunte
Ici
1
somme géométrique finie (annuité), série géométrique (perpétuité), limite exponentielle
théorèmes A.1 à A.3
4
somme géométrique finie (les coupons d'une obligation forment une annuité)
théorème A.1
5
perpétuité croissante de raison (1+g)/(1+r) (Gordon-Shapiro)
théorème A.2, exemple A.1
6
variance d'une somme, bilinéarité, −1≤ρ≤1, division par T−1
théorèmes A.5 à A.8
7
corrélation, droite des moindres carrés, erreur type de la pente, loi de Student
théorèmes A.9 à A.12
Toutes les valeurs numériques de cette annexe ont été recalculées par programme, en fractions exactes lorsque c'était possible. Les données d'exemple sont fictives, y compris celles qui reprennent les historiques inventés des chapitres 6 et 7.
Objectifs
Cette annexe vous permet de:
démontrer la somme d'une suite géométrique finie, énoncer la condition de convergence de la série géométrique et y reconnaître l'annuité, la perpétuité et la perpétuité croissante;
manipuler logarithmes et exponentielles pour trouver une durée ou un taux, et situer la capitalisation continue comme une limite;
calculer l'espérance, la variance et l'écart type d'une variable aléatoire définie sur quelques scénarios;
calculer une covariance et une corrélation, développer la variance d'une somme par bilinéarité, et démontrer que −1≤ρ≤1;
estimer ces grandeurs sur un échantillon et expliquer pourquoi l'on divise par n−1;
ajuster une droite des moindres carrés, lire son R2, calculer l'erreur type de la pente et son intervalle de confiance avec la loi de Student.
Suites et séries géométriques
La somme finie
En finance, la raison est presque toujours un facteur d'actualisationv=1/(1+r), ou le quotient (1+g)/(1+r) d'un facteur de croissance par un facteur de capitalisation. La question qui revient sans cesse est celle de la somme des n premiers termes.
Démonstration. Multiplions Sn par q: qSn=aq+aq2+⋯+aqn. Les deux sommes ont en commun tous les termes de aq à aqn−1; en les soustrayant, il ne reste que le premier terme de Sn et le dernier de qSn:
Sn−qSn=a−aqn,donc(1−q)Sn=a(1−qn).
Comme q=1, on peut diviser par 1−q. Si q=1, les n termes valent tous a. □
Retenez la forme «premier terme, fois un moins la raison à la puissance du nombre de termes, divisé par un moins la raison». Elle s'applique quel que soit l'indice de départ, pourvu qu'on identifie correctement le premier terme et le nombre de termes: c'est la source d'erreur la plus fréquente, bien plus que la formule elle-même.
La série infinie et sa condition de convergence
Démonstration. Si ∣q∣<1, alors ∣qn∣=∣q∣n→0 quand n→∞, et la somme partielle (A.1) tend vers a(1−0)/(1−q)=a/(1−q). Si ∣q∣≥1, le terme général vérifie ∣aqk∣=∣a∣∣q∣k≥∣a∣>0: il ne tend pas vers zéro, ce qui interdit toute convergence, puisque dans une série convergente Sk+1−Sk tend vers 0. □
La condition ∣q∣<1 n'est pas un détail technique: c'est elle qui donne une valeur finie à un flux sans fin. Trois cas du cours s'y ramènent.
L'annuité (chapitre 1, théorème 1.5): les n versements C aux dates 1,…,n valent ∑t=1nCvt, une somme finie de premier terme Cv et de raison v=1/(1+r). Pour r=0, la raison est différente de 1 et (A.1) s'applique; aucune condition de convergence n'est requise, puisque la somme est finie.
La perpétuité (théorème 1.7): la même série, prolongée à l'infini, converge si et seulement si ∣v∣<1, c'est-à-dire, pour r>−1, si et seulement si r>0. Sa valeur est Cv/(1−v)=C/r.
La perpétuité croissante (théorème 1.8, puis Gordon-Shapiro au chapitre 5): les flux C1(1+g)t−1 actualisés forment une série de premier terme C1/(1+r) et de raison q=(1+g)/(1+r). Comme et , la raison est positive, et la condition s'écrit simplement . Alors la somme vaut .
Question A.1
Lequel de ces flux perpétuels, dont le premier versement a lieu dans un an, a une valeur actuelle finie?
Logarithmes et exponentielle
Les règles de calcul
La fonction exponentiellex↦ex est définie sur tous les réels, strictement positive et strictement croissante; le logarithme naturelln est sa fonction réciproque, définie pour y>0: lny=x équivaut à ex=y. Quatre règles suffisent au cours:
La dernière est la définition même d'une puissance non entière: 1,072,5 n'a de sens que par elle. Deux propriétés d'analyse complètent le tableau: la dérivée de ln en x est 1/x, et ln(1+x)≤x pour tout x>−1, avec ln(1+x)≈x lorsque x est petit. La seconde se lit sur le graphe: la courbe concave ln(1+x) est sous sa tangente en 0, qui est la droite y=x.
Trouver une durée. Le logarithme sert d'abord à «descendre» un exposant. Combien d'années faut-il pour qu'un capital placé au taux r soit multiplié par K? On résout (1+r)t=K en prenant le logarithme des deux membres:
t=ln(1+r)lnK.(A.4)
Trouver un taux. Inversement, le taux qui multiplie un capital par K en t années est r=K1/t−1=e(lnK)/t−1: c'est aussi la définition de la moyenne géométrique des rentabilités du chapitre 6.
La capitalisation continue comme limite
Démonstration (esquisse). Pour m assez grand, ln((1+x/m)m)=x⋅x/mln(1+x/m) si x=0. Le quotient est le taux d'accroissement de ln entre 1 et 1+x/m; il tend vers la dérivée ln′(1)=1. Le logarithme tend donc vers x, et la continuité de l'exponentielle conclut. La démonstration complète est celle du théorème 1.4 du chapitre 1. □
Appliqué à un taux nominal rc capitalisé m fois par an, (A.5) dit que le facteur de capitalisation d'une année tend vers erc lorsque la fréquence devient infinie: c'est la capitalisation continue, avec la correspondance 1+r=erc, rc=ln(1+r), entre taux effectif et taux continu (relation (1.8) du chapitre 1). À 7 % nominal, le facteur vaut 1,07 en capitalisation annuelle, 1,07229 en mensuelle, 1,07250 en quotidienne et e0,07=1,07251 à la limite.
L'intérêt pratique de l'écriture continue est algébrique: par (A.3), des taux continus successifs s'additionnent, là où des taux effectifs se multiplient. C'est pourquoi on appelle rentabilité logarithmique la quantité ln(1+R): sur plusieurs périodes, les rentabilités logarithmiques s'additionnent exactement. Comme ln(1+R)≤R, elle est toujours un peu inférieure à la rentabilité simple, et l'écart croît avec ∣R∣.
Une variable aléatoire sur quelques scénarios
Espérance, variance, écart type
Le cours décrit l'incertitude de la manière la plus simple possible: un nombre fini de scénarioss=1,…,S, de probabilités ps>0 qui somment à 1. Une variable aléatoireX est alors simplement la donnée d'une valeur Xs par scénario — la rentabilité d'une action, le flux d'un projet, le dividende de l'an prochain. Tout ce qui suit vaut pour des lois plus générales, en remplaçant les sommes par des intégrales; le cours n'en a pas besoin.
Démonstration. (a) ∑sps(aXs+bYs+c)=a∑spsXs+b∑spsYs+c∑sps, et ∑sps=1. (b) Par (a), l'espérance de aX+c est aμ+c, donc son écart à l'espérance est a(X−μ), dont le carré est a2(X−μ)2. (c) On développe (X−μ)2=X2−2μX+μ2 et l'on applique (a): E[X2]−2μ2+μ2. (d) Une somme de termes positifs ps(Xs−μ)2 avec ps>0 est nulle si et seulement si chaque Xs vaut μ. □
La linéarité (a) ne demande aucune hypothèse d'indépendance: elle ne fait que réordonner une somme finie. C'est elle qui donne immédiatement l'espérance d'un portefeuille (chapitre 6): la rentabilité espérée d'un portefeuille est la moyenne pondérée des rentabilités espérées de ses titres. La variance, elle, n'est pas linéaire, comme le montre déjà (b), et c'est tout le sujet de la section suivante. La formule (c) est commode à la main, mais numériquement fragile: elle soustrait deux grands nombres voisins, et un tableur qui l'applique à des données peu dispersées peut rendre une variance négative par erreur d'arrondi. Pour calculer, préférez la définition.
Covariance et corrélation
Définitions et règles de calcul
Le signe de la covariance dit si les deux variables s'écartent ensemble de leur espérance (produits d'écarts surtout positifs) ou en sens opposés; sa taille dépend des unités, et c'est pourquoi on la normalise en corrélation.
Démonstration. (a) est immédiat sur la définition. (b) Par linéarité de l'espérance, l'écart à l'espérance de aX+bY+c vaut a(X−μX)+b(Y−μY): la constante c disparaît. En multipliant par Z−μZ et en prenant l'espérance, la linéarité donne aCov(X,Z)+bCov(Y,Z). (c) On développe (X−μX)(Y−μY)=XY−μYX−μXY+μXμY et l'on prend l'espérance: E[XY]−μXμY−μXμY+μXμY. □
La bilinéarité est l'outil de calcul du chapitre 6: elle permet de développer la covariance d'une combinaison de titres comme on développe un produit de sommes. En particulier, ajouter une constante — un placement sans risque, par exemple — ne change aucune covariance.
La variance d'une somme
Démonstration. Posons P=∑iwiXi. Par le théorème A.5 (a), Var(P)=Cov(P,P); la bilinéarité, appliquée une fois dans chaque argument, donne ∑i∑jwiwjCov(Xi,Xj), qui est (A.8). Pour n=2, les deux termes croisés w1w2σ12 et w2w1σ21 sont égaux, d'où le facteur 2 de (A.7). □
(A.7) est la formule de la variance d'un portefeuille de deux actifs (théorème 6.1), et (A.8) celle d'un portefeuille quelconque. Sur les n2 termes de la double somme, n seulement sont des variances; les n2−n autres sont des covariances. C'est ce décompte qui fait que, dans un grand portefeuille, les covariances l'emportent et que le risque tend vers la covariance moyenne (théorème 6.4).
Indépendance et corrélation nulle
Deux variables sont indépendantes si la probabilité de chaque couple de valeurs est le produit des probabilités: P(X=x,Y=y)=P(X=x)P(Y=y) pour tous x, y. Alors E[XY]=∑x,yxyP(X=x)P(Y=y)=E[X]E[Y], et la covariance est nulle par le théorème A.5 (c). La réciproque est fausse. Soit Z qui vaut −1, 0 ou 1 avec probabilité 1/3 chacun, et Y=Z2. Alors E[Z]=0 et E[ZY]=E[Z3]=0, donc Cov(Z,Y)=0; pourtant Y est entièrement déterminée par Z. La corrélation ne mesure que le lien linéaire. En finance, le cas se présente avec les options, dont le gain dépend du sous-jacent de manière très non linéaire.
Pour des variables indépendantes (ou simplement non corrélées deux à deux), (A.8) se réduit à ∑iwi2σi2: les variances s'additionnent. C'est ce qui servira pour la moyenne d'un échantillon.
L'encadrement de la corrélation
Démonstration. Si σX=0, X est constante (théorème A.4 (d)), sa covariance avec toute variable est nulle et (A.9) est une égalité 0=0. Supposons σX>0. Pour tout réel λ, la variable Y−λX a une variance positive ou nulle, et par (A.7)
0≤Var(Y−λX)=σY2−2λσXY+λ2σX2.
Le membre de droite est un trinôme du second degré en λ, de coefficient dominant positif, qui ne prend jamais de valeur négative: son discriminant est négatif ou nul, 4σXY2−4σX2σY2≤0, ce qui est (A.9). Diviser par σXσY donne l'encadrement de ρ.
Cas d'égalité: ∣ρ∣=1 équivaut à un discriminant nul, donc à l'existence d'une racine double λ∗=σXY/σX2 où Var(Y−λ∗X)=0. Par le théorème A.4 (d), Y−λ∗X est alors une constante α: Y=α+λ∗X, et λ∗ a le signe de σXY, c'est-à-dire de ρ. Réciproquement, si Y=α+βX, la bilinéarité donne σXY=βσX2 et le théorème A.4 (b) σY=∣β∣σX, d'où ρ=β/∣β∣=±1. □
La démonstration contient davantage que l'inégalité. La valeur λ∗=σXY/σX2minimise la variance de Y−λX, et le minimum vaut
Var(Y−λ∗X)=σY2−σX2σXY2=σY2(1−ρXY2).(A.10)
Lorsque X est la rentabilité du marché et Y celle d'un titre, λ∗ est exactement le bêta du chapitre 7, et (A.10) partage la variance du titre en une part systématiqueρ2σY2=β2σX2 et une part spécifique(1−ρ2)σY2 — la décomposition du risque de la fin du chapitre 6.
Question A.2
Avec les deux actions fictives de l'exemple A.3 (σX2=319, σY2=24, σXY=81, en %²), quelle est la volatilité d'un portefeuille qui place 25 % dans X et 75 % dans Y? Répondez en pour cent, avec deux décimales.
Estimer sur un échantillon
Moyenne, variance et covariance d'échantillon
Les espérances, variances et covariances «vraies» supposent connues les probabilités des scénarios, ce qui n'est jamais le cas. On les estime à partir d'observations passées X1,…,Xn — par exemple n rentabilités annuelles —, sous une hypothèse qu'il faut dire: ces observations sont des tirages indépendants d'une même loi, d'espérance μ et de variance σ2. C'est ce qu'on appelle un échantillon i.i.d. (indépendant et identiquement distribué). L'hypothèse est forte pour des rentabilités: elle suppose que la nature du titre n'a pas changé pendant la période observée.
On notera Sxx=∑t(Xt−Xˉ)2, Syy et Sxy les sommes de carrés et de produits d'écarts, comme au chapitre 7. Alors sX2=Sxx/(n−1), sXY=Sxy/(n−1), et dans le quotient rXY les facteurs n−1 se simplifient: rXY=Sxy/SxxSyy. L'inégalité de Cauchy-Schwarz vaut aussi pour ces sommes (appliquez le théorème A.7 à la loi qui donne le poids 1/n à chaque observation), et −1≤rXY≤1.
Pourquoi n−1
Démonstration. La première égalité est la linéarité de l'espérance. Pour la deuxième, Xˉ=∑tXt/n est une combinaison de variables indépendantes, donc non corrélées, et (A.8) se réduit à ∑tσ2/n2=σ2/n. Pour la troisième, écrivons Xt−μ=(Xt−Xˉ)+(Xˉ−μ) et élevons au carré en sommant sur t; le terme croisé 2(Xˉ−μ)∑t(Xt−Xˉ) est nul, parce que les écarts à la moyenne somment à zéro. Il reste l'identité
t=1∑n(Xt−Xˉ)2=t=1∑n(Xt−μ)2−n(Xˉ−μ)2.
En espérance, le premier terme vaut nσ2 (chaque carré a pour espérance σ2) et le second nVar(Xˉ)=n⋅σ2/n=σ2. D'où (n−1)σ2. □
L'identité dit exactement ce que le chapitre 6 annonçait: mesurés autour de Xˉ, qui a été calculée sur les mêmes données, les écarts sont plus petits que s'ils étaient mesurés autour de la vraie espérance μ — la moyenne d'échantillon est, par construction, le point qui minimise la somme des carrés des écarts. La perte vaut en moyenne exactement une variance σ2, et diviser par n−1 au lieu de n la compense. On dit que la somme des carrés a n−1 degrés de liberté: les n écarts Xt−Xˉ somment à zéro, et le dernier est déterminé par les n−1 autres. La même raison impose n−1 dans la covariance d'échantillon.
Deux remarques d'honnêteté. D'abord, si l'espérance μ était connue, la division par n de ∑t(Xt−μ)2 serait sans biais: le n−1 est le prix de l'estimation de μ. Ensuite, l'absence de biais porte sur s2, pas sur s: la racine étant concave, E[s] est légèrement inférieure à σ. L'écart est négligeable pour les tailles d'échantillon de la finance (60 mois et plus), et personne ne le corrige en pratique.
La deuxième égalité de (A.12) est l'erreur type de la moyenne du chapitre 6: l'écart type de Xˉ vaut σ/n, estimé par s/n. Elle ne décroît qu'en n, ce qui explique pourquoi les rentabilités espérées se mesurent si mal.
La régression linéaire simple
La droite des moindres carrés
On dispose de n couples d'observations (xt,yt) — au chapitre 7, la rentabilité du marché et celle d'un titre sur le mois t — et l'on cherche la droite y^=a+bx qui passe «au plus près» du nuage de points. Le critère des moindres carrés mesure l'écart par la somme des carrés des écarts verticaux.
Démonstration. Le chapitre 7 annule les deux dérivées partielles de Q. En voici une autre voie, qui donne aussi le minimum. Pour b fixé, Q est la somme des carrés des écarts des nombres yt−bxt à la constante a; elle est minimale lorsque a est leur moyenne (c'est l'identité de la démonstration du théorème A.8, avec une constante quelconque à la place de μ: ∑t(zt−c)2=∑t(zt−zˉ)2+n(zˉ−c)2), soit a=yˉ−bxˉ. En reportant, yt−a−bxt=(yt−yˉ)−b(xt−xˉ), et en développant le carré,
Le premier terme est positif et ne s'annule que pour b=Sxy/Sxx; le minimum est le second terme. Enfin, ∑tet=∑t(yt−yˉ)−b∑t(xt−xˉ)=0, et ∑t(xt−xˉ)et=Sxy−bSxx=0. □
La pente est le rapport de la covariance d'échantillon à la variance d'échantillon de x: c'est l'estimateur naturel du bêta Cov(ri,rM)/Var(rM) du chapitre 7, et la version d'échantillon du λ∗ du théorème A.7.
Qualité de l'ajustement: le R2
Démonstration. Comme y^t−yˉ=b(xt−xˉ), on a SCE=b2Sxx=Sxy2/Sxx. Par le théorème A.9, SCR=Syy−Sxy2/Sxx. La somme des deux est Syy. Enfin R2=Sxy2/(SxxSyy)=rxy2. □
Le R2 est la fraction de la variance de y que la droite reproduit; pour une régression de la rentabilité d'un titre sur celle du marché, c'est la part systématique du risque, et 1−R2 la part spécifique — la version d'échantillon de (A.10). Un R2 faible ne signifie pas que la pente est mal estimée, ni un R2 élevé qu'elle l'est bien: la précision de la pente est une autre question, qui demande un modèle.
Le modèle statistique et l'erreur type de la pente
Pour parler de la précision de b, il faut dire d'où viennent les données. Le modèle de la régression linéaire simple suppose que
yt=α+βxt+εt,t=1,…,n,
où α et β sont des paramètres inconnus — ceux que a et b estiment — et εt une perturbation aléatoire. Les xt sont traités comme donnés (on raisonne «à xt connus»), et l'on fait les hypothèses suivantes sur les perturbations:
(H1)E[εt]=0: la droite est juste en moyenne;
(H2)Var(εt)=σ2 pour tout t: même dispersion à chaque période (homoscédasticité);
(H3)Cov(εt,εu)=0 pour t=u: les perturbations de deux périodes ne sont pas corrélées;
(H4), seulement pour les intervalles exacts: les εt suivent une loi normale.
Ce sont exactement les conditions que le chapitre 7 énonce en une ligne avant (7.12): des résidus «indépendants, de même variance, et non corrélés au marché».
Démonstration. (a) Posons ct=(xt−xˉ)/Sxx. Ces poids vérifient ∑tct=0, ∑tctxt=∑tct(xt−xˉ)=1 et ∑tct2=Sxx/Sxx2=1/Sxx. Comme ∑t(xt−xˉ)yˉ=0, la pente s'écrit b=∑tctyt, et en y reportant le modèle,
b=αt∑ct+βt∑ctxt+t∑ctεt=β+t∑ctεt.
La pente estimée est la vraie pente plus une combinaison linéaire des perturbations. Par (H1), l'espérance de cette combinaison est nulle; par (H2), (H3) et (A.8), sa variance vaut ∑tct2σ2=σ2/Sxx.
(b) Le modèle donne yˉ=α+βxˉ+εˉ, donc yt−yˉ=β(xt−xˉ)+(εt−εˉ), et les résidus s'écrivent
et=(yt−yˉ)−b(xt−xˉ)=(εt−εˉ)−(b−β)(xt−xˉ).
En élevant au carré et en sommant, le terme croisé fait apparaître ∑t(xt−xˉ)(εt−εˉ)=∑t(xt−xˉ)εt=(b−β)Sxx, par la ligne précédente. D'où
SCR=t∑(εt−εˉ)2−(b−β)2Sxx.
Par (A.12), appliquée aux perturbations, le premier terme a pour espérance (n−1)σ2; par (a), le second a pour espérance SxxVar(b)=σ2. Il reste (n−2)σ2.
(c) découle de (a) et (b): on remplace σ inconnu par son estimation s. □
La démonstration de (b) est celle du n−1, une marche plus haut: la moyenne d'échantillon «colle» aux données et leur fait perdre un degré de liberté; la droite des moindres carrés, qui ajuste deux paramètres, leur en fait perdre deux. Les résidus satisfont deux contraintes linéaires (théorème A.9), et il n'en reste que n−2 de libres.
La formule (A.15) dit tout ce qui rend une pente précise: une dispersion résiduelle s faible, un grand nombre d'observations — Sxx croît à peu près comme n fois la variance des xt, de sorte que et(b) décroît en 1/n — et des xtbien étalés. Au chapitre 7, c'est ce dernier point qui explique qu'une période de marché calme mesure mal un bêta.
Intervalle de confiance et loi de Student
La démonstration demande deux faits de probabilités que ce cours n'établit pas — sous normalité, b est normale et SCR/σ2 suit une loi du khi-deux à n−2 degrés de liberté, indépendante de b — et nous l'admettons. L'énoncé demande en revanche d'être lu avec précision. La probabilité de 95 % porte sur la procédure: sur un grand nombre d'échantillons, 95 % des intervalles construits par (A.16) contiendraient β. Une fois l'intervalle calculé sur vos données, β est dedans ou ne l'est pas; dire qu'il y a «95 % de chances que le bêta soit entre 0,45 et 2,11» est un raccourci courant, mais ce n'est pas ce que dit le théorème. Le même quotient T sert à tester une valeur: si β0 est hors de l'intervalle (A.16), c'est-à-dire si ∣b−β0∣/et(b)>tn−2, les données la rejettent au seuil de 5 %.
La loi de Student, en un paragraphe. Si σ était connu, (b−β)/Var(b) suivrait une loi normale centrée réduite, dont le quantile à 97,5 % vaut 1,96. Mais on divise par une estimation de l'écart type, elle-même aléatoire: lorsqu'elle tombe trop bas, le quotient est gonflé. La loi de ce quotient a été calculée en 1908 par William Gosset, statisticien de la brasserie Guinness, qui publiait sous le pseudonyme de «Student». Elle est symétrique et en cloche comme la normale, mais avec des queues plus épaisses, d'autant plus que le nombre k de degrés de liberté est petit; sa variance vaut k/(k−2) pour k>2 (2 pour k=4, 1,25 pour k=10), et elle tend vers la loi normale quand k→∞. Concrètement, ses quantiles à 97,5 % sont plus grands que 1,96, et d'autant plus que l'échantillon est petit: 2,776 pour 4 degrés de liberté, 2,571 pour 5, 2,228 pour 10, 2,042 pour 30, 2,002 pour 58 (soit 60 mois de données), et 1,960 à la limite. Utiliser 1,96 avec 6 observations donnerait des intervalles trop étroits: pour 4 degrés de liberté, la probabilité que ∣T∣ dépasse 1,96 n'est pas de 5 % mais de 12,2 %. L'hypothèse de normalité (H4) est discutable pour des rentabilités, qui présentent plus de mois extrêmes qu'une loi normale ne le prévoit; pour des échantillons de quelques dizaines d'observations, le théorème central limite rend toutefois l'intervalle (A.16) approximativement valable, et c'est ainsi qu'il est employé en pratique.
Figure A.1. Densités de la loi normale centrée réduite (trait de la couleur du texte), de la loi de Student à 10 degrés de liberté (en bleu) et à 4 degrés de liberté (en couleur d'accent). Moins il y a de degrés de liberté, plus le sommet est bas et plus les queues sont épaisses; le quantile à 97,5 % s'éloigne d'autant de 1,96: 2,23 pour 10 degrés de liberté (la régression de douze mois de l'exemple 7.4), 2,78 pour 4 (les six mois de l'exercice 7.4). Les trois densités sont calculées dans le code de la figure; les quantiles ont été obtenus par intégration numérique et dichotomie.
Question A.3
Une régression sur 60 rentabilités mensuelles donne une pente b=0,90, une dispersion résiduelle s=5,0 % par mois et Sxx=1125 (%²). Le quantile de Student à 97,5 % pour 58 degrés de liberté vaut 2,002. Quelle est la borne supérieure de l'intervalle de confiance à 95 % de la pente? Donnez trois décimales.
Synthèse
La somme géométriquea+aq+⋯+aqn−1=a(1−qn)/(1−q) se démontre en soustrayant qSn de Sn; la série converge si et seulement si ∣q∣<1, vers a/(1−q). L'annuité, la perpétuité (r>0) et la perpétuité croissante (g<r) en sont trois cas.
Le logarithme descend les exposants: la durée pour multiplier un capital par K est lnK/ln(1+r). La capitalisation continue est la limite (1+x/m)m→ex, et les rentabilités logarithmiques s'additionnent.
Sur des scénarios, l'espérance est linéaire sans condition; la variance ne l'est pas: Var(w1X1+w2X2)=w12σ12+w22σ22+2w1w2σ12, conséquence de la de la covariance.
L'inégalité de Cauchy-Schwarz donne −1≤ρ≤1, avec ρ=±1 exactement pour une relation affine; le coefficient qui minimise Var(Y−λX) est le bêta, et le minimum σY2(1−ρ2) est le risque spécifique. Une corrélation nulle n'est pas l'indépendance.
Sur un échantillon, on divise par n−1 parce que les écarts sont mesurés autour de Xˉ: E[∑(Xt−Xˉ)2]=(n−1)σ2. L'erreur type de la moyenne est .
La régression des moindres carrés a pour pente Sxy/Sxx et pour R2 le carré de la corrélation. Sous les hypothèses du modèle, la pente est sans biais, d'erreur types/Sxx avec , et l' utilise la loi de , plus large que la normale pour les petits échantillons.
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Exercice A.1 · Une bourse perpétuelle qui commence dans six ans
Une fondation veut financer à perpétuité une bourse de CHF 50 000 par an, dont le premier versement aura lieu à la fin de l'année 6. Le taux d'actualisation est de 4 %.
Écrivez la valeur actuelle comme une série géométrique, identifiez son premier terme et sa raison, et calculez-la.
Retrouvez ce résultat comme la différence entre une perpétuité qui commence à la date 1 et une annuité de cinq ans.
Le conseil de fondation veut indexer la bourse de 2 % par an à partir du premier versement. Quel capital faut-il aujourd'hui? Et pour une indexation de 5 % par an?
Solution
Les versements ont lieu aux dates 6,7,8,… La valeur actuelle est ∑t≥650000×1,04−t, une série de premier terme 50000×1,04−6 et de raison 1/1,04<1, donc convergente. Par (A.2),
La lecture financière est immédiate: à la date 5, la bourse est une perpétuité ordinaire qui vaut 50000/0,04=CHF 1250000; on actualise ce montant sur cinq ans.
La perpétuité complète (dates 1,2,…) vaut CHF 1 250 000; l'annuité des dates 1 à 5 vaut, par (A.1), 50000×(1−1,04−5)/0,04=CHF 222591. La différence, CHF 1 027 409, est la même: la perpétuité différée est ce qui reste de la perpétuité quand on en retire les cinq premiers versements.
Avec une indexation de 2 %, la série a pour raison 1,02/1,04<1. À la date 5, c'est une perpétuité croissante de premier flux CHF 50 000, qui vaut ; aujourd'hui, . L'indexation double le capital nécessaire. Avec 5 %, la raison vaut : la série diverge, et capital fini ne suffit. La fondation ne peut promettre une croissance supérieure au rendement de ses placements.
Exercice A.2 · Durées, taux continus et rentabilités logarithmiques
Combien d'années faut-il pour que CHF 10 000 placés à 3 % effectif par an deviennent CHF 25 000?
Quel taux continu est équivalent à 3 % effectif? Vérifiez qu'il donne la même durée qu'en 1.
Une action enchaîne trois années de rentabilités +20%, −20% et +10%. Calculez ses trois rentabilités logarithmiques, leur somme, et déduisez-en la rentabilité totale sur trois ans. Comparez avec la somme des rentabilités simples, puis donnez la moyenne géométrique annuelle.
Solution
Par (A.4) avec K=2,5: t=ln2,5/ln1,03=0,9163/0,02956=31,00 ans (30,9989 exactement).
rc=ln1,03=2,9559%. En capitalisation continue, la durée est ln2,5/rc, qui est identiquement le calcul de 1., puisque rc=ln1,03: 31,00 ans. Deux taux équivalents donnent par définition la même croissance, donc les mêmes durées.
ln1,2=0,1823, ln0,8=−0,2231 et ln1,1=0,0953. Leur somme vaut 0,0545, d'où une rentabilité totale de e0,0545−1=5,6%; on le vérifie directement: . La somme des rentabilités simples, 10 %, surestime la croissance de près du double: elle traite la baisse de 20 % comme si elle compensait la hausse de 20 %, alors qu'elle porte sur un capital plus grand. La moyenne géométrique est par an, La moyenne des rentabilités logarithmiques, , n'est autre que : le logarithme d'un plus la moyenne géométrique.
Exercice A.3 · Un marché, une action, trois scénarios
Trois scénarios fictifs de probabilités 0,25, 0,50 et 0,25 donnent au marché les rentabilités M=−10, 6 et 22 %, et à une action les rentabilités B=−2, 4 et 14 %.
Calculez E[M], E[B], Var(M) et Var(B), par la définition puis par König-Huygens.
Calculez Cov(M,B) de deux façons, la corrélation et le coefficient β=Cov(M,B)/Var(M).
Solution
E[M]=−2,5+3+5,5=6% et E[B]=−0,5+2+3,5=5%. Les écarts sont , , pour et , , pour , d'où
Exercice A.4 · Le n − 1, dans le plus petit cas et en général
Pour un échantillon de deux observations, montrez que ∑t(Xt−Xˉ)2=(X1−X2)2/2, puis, pour des tirages i.i.d. de variance σ2, que E[(X1−X2)2]=2σ2. Concluez sur s2 et sur la division par n.
Montrez que si l'espérance μ est connue, n1∑t(Xt−μ)2 est un estimateur sans biais de .
Pourquoi, dans la régression du théorème A.11, divise-t-on par n−2 et non par n−1?
Solution
Avec Xˉ=(X1+X2)/2, on a X1−Xˉ=(X1−X2)/2 et ; la somme des carrés vaut . Ensuite, a pour espérance et, par (A.7) avec des tirages indépendants, pour variance ; son carré a donc pour espérance . La somme des carrés des écarts a pour espérance avec : la division par donne un estimateur sans biais, la division par donne en moyenne , soit de la vraie variance. C'est le cas extrême du biais .
Exercice A.5 · Un bêta sur cinq ans, et la régression à l'envers
Sur 60 mois fictifs, les rentabilités d'un indice (xt) et d'une action (yt) donnent xˉ=0,5%, yˉ=0,8%, Sxx=1100, Sxy=1320 et Syy=3200 (en %²).
Calculez la pente b, l'ordonnée a, la somme des carrés des résidus et le R2.
Calculez s, l'erreur type de la pente et son intervalle de confiance à 95 % (quantile de Student à 97,5 % pour 58 degrés de liberté: 2,002). Traduisez les deux bornes en coûts des fonds propres avec les paramètres du cours (rf=1%, prime de marché 5 points).
Un analyste régresse par erreur l'indice sur l'action, obtient une pente b′ et propose comme bêta. Calculez et , montrez que en général, et concluez.
Solution
b=1320/1100=1,2 et a=0,8−1,2×0,5=0,2% par mois. Par le théorème A.9, , et : la moitié de la variance de l'action est systématique.
Références
Wooldridge J. M., Introductory Econometrics: A Modern Approach, Cengage — chapitre 2 pour la régression simple, ses hypothèses et la démonstration de l'absence de biais; annexes B et C pour les rappels de probabilités et d'estimation.
Berk J. et DeMarzo P., Finance d'entreprise, Pearson — les chapitres sur la valeur temps (séries géométriques) et sur le risque et la rentabilité, qui utilisent exactement ces outils.
Ross S., A First Course in Probability, Pearson — pour l'espérance, la variance, la covariance et l'inégalité de Cauchy-Schwarz sur des lois discrètes, avec démonstrations.
Brealey R., Myers S. et Allen F., Principes de gestion financière, Pearson — pour l'estimation du bêta par régression et la lecture de son erreur type en pratique.
Analyse I, sur cette plateforme — chapitre 4, «Séries numériques», pour la démonstration complète des séries géométriques et des critères de convergence.
g>−1
r>−1
∣q∣<1
g<r
1−(1+g)/(1+r)C1/(1+r)=r−gC1
1,05−30=0,2314
q=1,03/1,07=103/107=0,9626
q<1
μY=−1+1,5+1,5+2=4%
E[X2]=355
355−62=319
E[Y2]=40
40−42=24
corrélation
ρXY=1
Y=α+βX
β>0
ρXY=−1
β<0
X
3,43
Y
1−ρ2
vend
covariance d'échantillon
corrélation d'échantillon
Sxy=852
852/5=170,4
résidus
SCR=∑tet2
somme des carrés des résidus
∑t(xt−xˉ)et=0
(xˉ,yˉ)
r=0,7373
T=1,2817/0,3714=3,45>2,228
1,6391/1,429=1,15<2,228
bilinéarité
σ/n
s2=SCR/(n−2)
intervalle de confiance
b±tn−2et(b)
Student
50000/(0,04−0,02)=CHF 2500000
2500000×1,04−5=CHF 2054818
1,05/1,04>1
aucun
1,2×0,8×1,1=1,056
1,0561/3−1=1,83%
0,0545/3=1,82%
ln1,0183
Vérifiez (A.10): calculez la variable B−βM dans chaque scénario et sa variance.
Calculez la volatilité d'un portefeuille investi à 60 % dans le marché et à 40 % dans l'action.
Par König-Huygens: E[M2]=164 et 164−36=128; E[B2]=58 et 58−25=33.
Par la définition, Cov(M,B)=0,25×112+0,5×0+0,25×144=64 %²; par le théorème A.5 (c), E[MB]=94 et 94−6×5=64. Avec σM=11,31% et σB=5,74%, ρ=64/(11,31×5,74)=0,985, et β=64/128=0,5.
B−0,5M vaut −2+5=3, 4−3=1 et 14−11=3: espérance 2, écarts , , , variance %². Par (A.10), : le compte est exact. La part systématique est de 32 %² sur 33, le risque spécifique de 1 %² seulement, ce que traduit une corrélation proche de 1.
Par (A.7): 0,36×128+0,16×33+2×0,6×0,4×64=46,08+5,28+30,72=82,08 %², soit , à peine moins que la moyenne pondérée des volatilités, . Avec , la diversification ne sert presque à rien.
σ2
X2−Xˉ=−(X1−X2)/2
2×(X1−X2)2/4=(X1−X2)2/2
X1−X2
0
σ2+σ2=2σ2
2σ2
σ2=(n−1)σ2
n=2
n−1=1
n=2
σ2/2
la moitié
(n−1)/n
Chaque (Xt−μ)2 a pour espérance Var(Xt)=σ2 par définition; la moyenne de n tels termes a donc pour espérance σ2. Aucune correction n'est nécessaire, parce qu'aucun paramètre n'a été estimé sur les données: la perte d'un degré de liberté est le prix de l'estimation de μ par Xˉ.
La droite des moindres carrés ajuste deux paramètres, a et b, et les résidus satisfont deux contraintes, ∑et=0 et ∑(xt−xˉ)et=0 (théorème A.9). La démonstration du théorème A.11 (b) montre que la somme des carrés des résidus perd en moyenne une variance σ2 pour chaque paramètre: E[SCR]=(n−1)σ2−σ2=(n−2)σ2.
1/b′
b′
1/b′
bb′=R2
SCR=3200−13202/1100=3200−1584=1616
R2=1−1616/3200=0,495
s2=1616/58=27,86, donc s=5,278% par mois, et et(b)=5,278/1100=0,1592. L'intervalle vaut 1,2±2,002×0,1592=[0,881;1,519]. Par le MEDAF, les deux bornes donnent un coût des fonds propres de 1+0,881×5=5,41% et de 1+1,519×5=8,59% par an. Cinq ans de données réduisent l'erreur type de l'exemple A.6 de plus de moitié, mais un écart de plus de 3 points sur le coût des fonds propres reste considérable.
La régression de x sur y a pour pente b′=Sxy/Syy=1320/3200=0,4125, et 1/b′=2,42, le double du bêta. En général,
bb′=SxxSxy⋅SyySxy=SxxSyySxy2=rxy2=R2,
ici 1,2×0,4125=0,495. Les deux droites ne coïncident donc que si R2=1. La raison est dans le critère: la régression de y sur x minimise les écarts verticaux, celle de x sur y les écarts horizontaux; ce sont deux problèmes différents. Le bêta est la pente de la rentabilité du titre sur celle du marché, Cov/Var(rM), et l'ordre des variables n'est pas une convention.