Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
- distinguer maximum et minimum, local et global, strict et large, et de ne pas confondre un extremum avec un point critique;
- écrire et démontrer la condition nécessaire du premier ordre (théorème de Fermat) et calculer les points critiques d'une fonction de plusieurs variables;
- classer un point critique non dégénéré par la hessienne, et en deux variables par le test ;
- traiter à la main le cas douteux en étudiant le long de droites, de paraboles ou par un raisonnement de signe;
- chercher les extrema d'une fonction continue sur un compact en combinant points critiques intérieurs et étude séparée du bord, et conclure par le théorème des bornes;
- reconnaître une fonction coercive sur un domaine non borné et en déduire l'existence d'un minimum global;
- dériver les équations normales de la méthode des moindres carrés et résoudre un problème d'optimisation libre à deux variables de conception.
Le vocabulaire des extremums
Maximum, minimum, local, global, strict
Optimiser, c'est chercher le meilleur: le dimensionnement le moins coûteux, la trajectoire la plus rapide, le jeu de paramètres qui rend un modèle le plus proche des mesures. Dès que le problème a plus d'une variable de décision, c'est l'analyse à plusieurs variables qui fournit les outils. Ce chapitre traite le cas libre, c'est-à-dire sans contrainte d'égalité entre les variables; le chapitre 8 traitera le cas lié, où les variables sont astreintes à une ou plusieurs relations .
Commençons par fixer le vocabulaire, car beaucoup d'erreurs d'examen sont des erreurs de vocabulaire.
Trois remarques valent d'être retenues dès maintenant.
Un extremum global est local, la réciproque est fausse. Une fonction peut avoir plusieurs minimums locaux de valeurs différentes; un seul d'entre eux (au mieux) est global. C'est précisément ce qui rend l'optimisation numérique difficile: un algorithme de descente s'arrête au premier minimum local rencontré, et rien dans l'information locale ne dit s'il est global.
Le maximum, s'il existe, est unique comme valeur, pas comme point. La fonction atteint la valeur en une infinité de points . On dit que le maximum global vaut et qu'il est atteint sur un ensemble de points.
L'existence n'est jamais gratuite. n'a ni maximum ni minimum sur ; a un maximum global mais pas de minimum. Nous verrons deux théorèmes d'existence: le théorème des bornes sur un compact (chapitre 2) et un argument de coercivité sur un domaine non borné.
Ce que l'Analyse I nous a appris, et ce qu'il faut réapprendre
En une variable (Analyse I, chapitre 8), le tableau est simple et complet. Si est dérivable sur un intervalle ouvert et admet un extremum local en , alors . Réciproquement, si et , on a un minimum local strict. Et s'il y a doute, le tranche: négative puis positive donne un minimum, positive puis négative un maximum, de même signe des deux côtés donne un point d'inflexion à tangente horizontale.
Trois de ces quatre outils survivent en dimension ; le quatrième, non.
- La condition devient : c'est le théorème de Fermat, démontré plus bas.
- La condition devient « définie positive»: la dérivée seconde est remplacée par une dont il faut classer la forme quadratique associée (chapitre 5 et annexe A).
C'est cette dernière remarque qui doit guider votre prudence. L'intuition d'une variable, transportée telle quelle, ment; les théorèmes, eux, restent vrais parce qu'ils ont été démontrés dans le bon cadre.
Extremum n'est pas point critique
La définition suivante a déjà été posée au chapitre 5 (juste avant le théorème 5.9); nous la rappelons parce qu'elle est le pivot de tout ce chapitre.
«Point critique» est une propriété du gradient; «extremum» est une propriété des valeurs de autour du point. Les deux notions sont reliées par le théorème de Fermat, mais elles ne coïncident pas: sur , la fonction a un point critique en l'origine sans y avoir d'extremum, et la fonction a un minimum global en l'origine sans y avoir de point critique — elle n'y est même pas différentiable.
Le mot selle vient de l'image: au voisinage de l'origine, le graphe de ressemble à une selle de cheval, montant dans la direction du cavalier et descendant sur les flancs. On dit aussi col, par analogie avec un col de montagne: point le plus bas de la crête et point le plus haut du chemin qui franchit la crête.
La condition nécessaire du premier ordre
Le théorème de Fermat
Démonstration. Traitons le cas d'un minimum local; le cas d'un maximum s'en déduit en remplaçant par , qui a un minimum local là où a un maximum et dont le gradient est .
Soit tel que (possible car est ouvert) et sur cette boule. Fixons et introduisons la
définie pour puisque le point considéré reste alors dans . Par définition de la dérivée partielle, est dérivable en et .
Or pour tout de : la fonction d'une variable admet un minimum local en , qui est un point à son intervalle de définition. Le théorème de Fermat d'Analyse I (chapitre 8) donne alors .
Reprenons-en l'argument, il tient en deux lignes et il est instructif. Pour , le taux d'accroissement est ; en faisant , on obtient . Pour , le même quotient est (numérateur positif, dénominateur négatif); en faisant , on obtient . Les deux inégalités donnent .
Ceci vaut pour chaque , donc toutes les composantes de sont nulles.
La démonstration montre bien où chaque hypothèse sert. L'ouverture de sert à disposer d'un voisinage de part et d'autre de dans chaque direction de coordonnée: c'est elle qui permet de faire tendre vers des deux côtés. L'existence des dérivées partielles sert à donner un sens à . Aucune continuité n'est requise: le théorème s'applique même à une fonction discontinue en dehors de , pourvu que ses dérivées partielles existent en .
Calculer les points critiques
Chercher les points critiques, c'est résoudre le système , soit équations à inconnues. En général non linéaire, ce système peut n'avoir aucune solution, en avoir un nombre fini ou une infinité.
Deux réflexes de calcul rendent service. Le premier: factoriser avant de diviser. Dans le système , , on ne divise pas par ni par sans discuter les cas et , sous peine de perdre des solutions. Le second: . Pour , la différence des deux équations du gradient donne , ce qui sépare aussitôt les cas et — nous utiliserons cette factorisation à la section de l'explorateur.
Soit une fonction de classe sur qui atteint son maximum global sur le disque fermé en un point . Que peut-on affirmer avec certitude?
La condition suffisante du second ordre
Ce que le chapitre 5 a mis en place
Le chapitre 5 a établi deux résultats dont nous allons faire un usage constant, et qu'il est inutile de redémontrer ici.
Le premier est la formule de Taylor à l'ordre deux avec reste de Young: si est de classe sur un ouvert et , alors pour assez petit
où est la , symétrique par le théorème de Schwarz.
Le second est la classification des formes quadratiques. À une matrice symétrique on associe ; (et avec elle) est dite définie positive si pour tout , définie négative si pour tout , et indéfinie si prend des valeurs strictement positives et strictement négatives. Le théorème spectral (annexe A) assure que est diagonalisable dans une base orthonormée de vecteurs propres, et que le signe de se lit sur les valeurs propres.
Nous aurons besoin d'un lemme quantitatif, très simple mais essentiel: une forme définie positive n'est pas seulement positive, elle est minorée par un multiple du carré de la norme.
Démonstration. Par le théorème spectral, il existe une base orthonormée de formée de vecteurs propres, . Écrivons ; comme la base est orthonormée, et
Comme pour tout , on encadre terme à terme: , ce qui est exactement (7.3). Si , la minoration donne pour ; réciproquement, si est définie positive, alors .
On peut lire (7.3) géométriquement: sur la sphère unité , qui est un compact, la fonction continue atteint son minimum (chapitre 2), et ce minimum vaut . L'homogénéité propage ensuite l'inégalité à tout . Cette lecture par compacité est celle qu'il faut retenir: elle se transpose telle quelle à d'autres situations où l'on ne dispose pas du théorème spectral.
Le critère de la hessienne
Le résultat qui suit est le théorème 5.9 du chapitre 5: il y est énoncé et démontré, et ce n'est pas un oubli s'il reparaît ici. Le critère est l'outil central de ce chapitre, et nous le redonnons avec sa démonstration pour que le chapitre se suffise à lui-même — la preuve ci-dessous est d'ailleurs écrite de façon à faire apparaître explicitement la minoration quadratique (7.4), dont nous nous servirons ensuite.
Démonstration. (1) Notons la plus petite valeur propre de . Comme , la formule (7.2) s'écrit
Par le théorème 7.2, , donc
Choisissons tel que et dès que — c'est possible, c'est la définition même de . Alors, sur cette boule épointée,
ce qui est bien un minimum local strict. Remarquons que la démonstration donne davantage qu'une inégalité large: elle fournit une minoration quadratique explicite, qui contrôle la vitesse à laquelle remonte.
(2) S'applique à , dont la hessienne est , définie positive.
(3) Supposons indéfinie et soient et tels que et , où ; quitte à normaliser, . Posons . La formule (7.2) appliquée à donne, en utilisant l'homogénéité ,
et pour assez petit la parenthèse est : est strictement supérieure à le long de la direction . Le même calcul avec montre que est strictement inférieure à le long de . Aucun voisinage de , si petit soit-il, ne peut donc porter une inégalité de signe constant: n'est ni un maximum ni un minimum local.
(4) Voir la section suivante, où cinq exemples de hessienne dégénérée donnent cinq verdicts différents.
La figure 7.1 mérite une lecture attentive, car elle donne la signature visuelle des trois cas sur des lignes de niveau — c'est ainsi que l'on lit une carte topographique ou une carte de potentiel. Autour d'un minimum ou d'un maximum, les lignes de niveau sont des courbes fermées emboîtées, et toutes les valeurs voisines sont du même côté de la valeur critique. Autour d'un col, le niveau critique lui-même se croise en formant un X, et les quatre secteurs qu'il délimite alternent: deux au-dessus, deux au-dessous. Sur une carte de randonnée, c'est exactement le dessin d'un col entre deux sommets.
Le test pratique en deux variables
En deux variables, on n'a pas besoin de calculer les valeurs propres. Notons, avec la notation classique de Monge et celle du chapitre 5,
Rappelons la convention de lecture fixée par la relation (5.2) du chapitre 5: dans la notation indicielle, l'indice le plus proche de dérive en premier, de sorte que — les deux notations se lisent en sens contraires. Comme est de classe , le théorème de Schwarz donne : la hessienne est symétrique et le coefficient est le même quel que soit l'ordre choisi. Nous écrirons donc partout où la place manque.
Le déterminant et la trace de cette matrice sont respectivement le produit et la somme de ses deux valeurs propres :
Démonstration. Si , les deux valeurs propres sont de même signe, et ce signe est celui de . Or lorsque , et sont eux-mêmes de même signe (car ), donc le signe de est celui de , donc celui des valeurs propres: donne une hessienne définie positive et une hessienne définie négative. Si , les valeurs propres sont de signes opposés et la hessienne est indéfinie. On applique alors le théorème 7.3.
On peut aussi éviter le théorème spectral par une simple mise sous forme canonique. Pour ,
identité que l'on vérifie en développant. Si et , les deux coefficients et sont positifs et ne s'annule que si puis : est définie positive. Si , les deux coefficients sont de signes opposés et prend les deux signes.
Voici le test sous la forme d'un tableau à consulter.
| Signe de | Valeurs propres | Nature de | Lignes de niveau voisines | |
|---|---|---|---|---|
| deux |
Classification complète de la fonction témoin
Soit . Cette fonction possède un unique point critique, qui est un minimum local strict. Quelle est la valeur de ce minimum?
L'explorateur: voir un col devenir un minimum
L'explorateur ci-dessous met en scène une famille à deux paramètres,
qui contient la fonction témoin pour , . Les points critiques y sont résolus exactement, pas approchés. En effet, en soustrayant les deux équations du gradient,
donc ou ; dans chacun des deux cas il reste une équation du second degré, dont les discriminants valent respectivement et . C'est ce qui explique que le de points critiques puisse valoir , ou selon .
Famille f(x, y) = x³ + y³ − 3a·xy + b·(x + y). Les points critiques sont résolus exactement à chaque déplacement de curseur, puis classés par le signe de det H et de r = ∂²f/∂x². Avec b = 0, faites passer a de +1 à −1: le point (a, a) cesse d'être un minimum et devient un maximum, en traversant le cas douteux a = 0 où il ne reste qu'un seul point critique. Avec a = 0,5 et b = −1,5, la famille possède quatre points critiques.
Trois manipulations à faire, dans l'ordre:
- Laissez et faites décroître de à . Le point , minimum local tant que , devient un maximum local dès que , en passant par où les deux points critiques fusionnent en un seul, dégénéré (). C'est la reclassification annoncée: la nature d'un point critique n'est pas attachée au point, elle est attachée à la fonction.
Le cas douteux: quand le déterminant s'annule
Le chapitre 5 en donnait déjà deux exemples; en voici cinq, choisis pour couvrir tous les verdicts possibles. Dans chaque cas l'origine est un point critique et la hessienne en a un déterminant nul.
1. : minimum global strict. Le gradient s'annule en , et toutes les dérivées secondes , , y sont nulles: est la matrice nulle, . Mais avec égalité seulement en : c'est un minimum global strict. Aucun calcul de dérivée n'est nécessaire, .
2. : point de selle. Même gradient nul, même hessienne nulle, même . Mais et pour : deux directions de signes opposés, donc ni maximum ni minimum. La méthode est celle du théorème 7.3, cas indéfini, appliquée à l'ordre au lieu de l'ordre .
3. : minimum global strict. Ici : une valeur propre vaut , l'autre , donc et la hessienne est sans être définie. Le critère est muet, mais avec égalité seulement en : minimum global strict. C'est la direction , celle de la valeur propre nulle, qui porte l'information: y croît comme , plus lentement qu'une parabole mais elle croît.
4. : une droite entière de minimums. Le gradient s'annule sur tout l'axe , et en chacun de ces points. Chaque point de l'axe est un minimum global, mais : vaut tout le long de l'axe. Les extremums non stricts sont fréquents dès qu'une variable n'intervient pas, et l'ensemble des points où l'optimum est atteint est alors une courbe ou une surface, pas un point isolé.
5. : ni maximum ni minimum. Le gradient s'annule sur l'axe , la hessienne y est nulle. Or change de signe en : aucun point de l'axe n'est un extremum. C'est la transposition exacte de en , le point d'inflexion à tangente horizontale d'Analyse I.
Les trois techniques de l'étude directe
Ces cinq exemples illustrent trois techniques, qui suffisent presque toujours en pratique.
Le raisonnement de signe. Si l'on peut écrire comme une somme de termes de même signe (souvent une somme de carrés ou de puissances paires), le verdict est immédiat et global, pas seulement local. C'est le cas de , de , de .
L'étude le long de courbes. Pour réfuter un extremum, il suffit d'exhiber deux chemins partant de le long desquels a des signes opposés. Les droites sont le premier réflexe, mais elles ne suffisent pas toujours; il faut parfois des paraboles.
La restriction à une direction dégénérée. Quand une valeur propre de est nulle, c'est la direction propre associée qu'il faut explorer en premier: les autres directions sont déjà décidées par le second ordre, et toute l'indétermination est concentrée dans celle-là. Pour comme pour , la direction douteuse est , et c'est le terme en ou qui tranche ( donne un minimum, un col).
Remettez dans l'ordre la démarche complète de recherche des extremums locaux d'une fonction de classe sur un ouvert de .
Glissez les éléments pour les mettre dans le bon ordre
- Résoudre le système pour obtenir la liste des points critiques
- Calculer les trois dérivées secondes , , et le discriminant en chaque point critique
- Aux points où , étudier directement le signe de ou chercher deux chemins de signes opposés
- Vérifier que est de classe sur l'ouvert considéré
- Examiner séparément le comportement de à l'infini pour décider si un extremum local est global
- Conclure par le test du discriminant aux points où
Extremums sur un compact
Existence: le théorème des bornes
Les fonctions les plus intéressantes en ingénierie sont étudiées sur un domaine borné: une plaque, une pièce, un intervalle de température admissible, un budget. Dans ce cadre, un théorème d'existence règle la question préalable.
Ce théorème, démontré au chapitre 2 à partir du théorème de Bolzano–Weierstrass, est un résultat d'existence pure: il affirme que le maximum et le minimum globaux existent, sans donner le moindre moyen de les localiser. Les deux hypothèses sont indispensables: sur , qui n'est pas fermé, n'est pas bornée; sur , qui n'est pas borné, est bornée sans atteindre ses bornes.
La méthode en deux temps
Sachant que les extremums globaux existent, il reste à les trouver. Un point de est soit intérieur, soit sur le bord ; le théorème de Fermat s'applique au premier cas et pas au second. D'où la méthode:
Le point 1 mérite une insistance: dans cette méthode, on ne calcule pas la hessienne. C'est une dépense inutile, car la comparaison finale des valeurs tranche de toute façon — et elle, elle est fiable. Un col intérieur figurera bien dans la liste des candidats, mais sa valeur sera automatiquement écartée par la comparaison, puisqu'il existe par définition des points voisins où est plus grande et d'autres où elle est plus petite. Le point 2, lui, est l'étape que les copies oublient, et c'est celle qui contient le plus souvent la réponse.
Sur le carré , quel est le maximum global de la fonction témoin ?
Domaines non bornés: la coercivité
Sur un domaine non borné, le théorème des bornes ne s'applique plus, et l'on a vu avec la fonction témoin qu'un minimum local peut fort bien n'être pas global. Il existe pourtant une condition simple et très utilisée qui restaure l'existence d'un minimum global: il suffit que «remonte à l'infini dans toutes les directions».
Démonstration. Fixons un point quelconque, disons , et posons . Par coercivité appliquée au seuil , il existe tel que dès que .
La boule fermée est un compact non vide (elle contient ) et y est continue: par le théorème 7.5, y atteint son minimum en un point , et
Soit maintenant quelconque. Si , alors par définition de . Si , alors . Dans les deux cas : réalise le minimum global sur tout entier.
Enfin, est un point intérieur de (tous les points le sont), donc le théorème de Fermat s'applique et .
La démonstration est un exemple parfait de la façon dont on fabrique un compact là où il n'y en avait pas: la coercivité sert exactement à enfermer le minimum dans une boule, après quoi Weierstrass fait le travail. Retenez aussi la conséquence pratique: pour une fonction coercive, il suffit de calculer toutes les valeurs critiques et de prendre la plus petite — aucune étude de bord, aucune étude à l'infini n'est nécessaire.
Parmi ces fonctions définies sur , laquelle n'est PAS coercive?
Application: la méthode des moindres carrés
Le problème et les équations normales
Un capteur, un essai de traction, une mesure de rendement: on dispose de couples et l'on suspecte une loi affine . Les mesures étant entachées d'erreurs, aucune droite ne passe exactement par tous les points; on cherche donc celle qui minimise la somme des carrés des écarts verticaux
C'est un problème d'extremum libre en les deux variables et — les données sont des constantes. Le choix du carré des écarts, plutôt que de leur valeur absolue, n'est pas anodin: il rend différentiable partout et, nous allons le voir, ramène le problème à un système linéaire.
Démonstration. est un polynôme du second degré en , donc de classe . Dérivons sous le signe somme, en prenant garde au facteur et venant de la dérivation de la parenthèse:
Annuler ces deux expressions et développer donne exactement (7.9). C'est un système linéaire en , de matrice
est la hessienne de , constante puisque est quadratique.
Montrons que est définie positive. Son déterminant vaut
Par l'inégalité de Cauchy–Schwarz appliquée aux vecteurs et ,
avec égalité si et seulement si les deux vecteurs sont colinéaires, c'est-à-dire si tous les sont égaux. Comme on l'a exclu, ; et . Par le théorème 7.4, le point critique est un minimum local strict. Il est même global: la hessienne étant définie positive , la formule de Taylor (7.2) est ici (le reste d'une fonction quadratique est nul au-delà de l'ordre 2), et l'on a pour tout
où et : le minimum est global et strict. La résolution du système par les formules de Cramer donne (7.10).
Un ajustement complet
Deux remarques pour finir. D'abord, la méthode s'étend sans changement à un ajustement par , où les sont des fonctions fixées: reste quadratique en les , les équations normales restent linéaires, et la hessienne reste où est la matrice de Gram des évaluées aux . Ensuite, : ils ne testent pas le modèle. Ajuster une droite à des données courbes donne toujours une droite, avec des coefficients parfaitement définis; c'est l'examen des résidus — cherchent-ils à former un arc? — qui révèle l'inadéquation. La méthode remonte à Legendre (1805) et à Gauss, qui l'utilisa pour retrouver l'astéroïde Cérès à partir d'un court arc d'observations.
Application: optimiser un choix de conception
Les problèmes de conception se formulent presque toujours avec une contrainte (un volume imposé, un budget). Quand la contrainte permet d'éliminer une variable, le problème redevient libre et relève de ce chapitre; sinon, il faut les multiplicateurs de Lagrange du chapitre 8. Voici un cas franchement libre, tiré de l'économie de la production.
Synthèse
- Le premier ordre fabrique des candidats, il ne conclut jamais. Si admet un extremum local en un point intérieur où ses dérivées partielles existent, alors (théorème de Fermat, démontré en restreignant à ses fonctions partielles). La réciproque est fausse et l'hypothèse d'intériorité est essentielle: un extremum sur le bord du domaine, ou en un point de non-différentiabilité, échappe complètement à ce test.
- Le second ordre trie les candidats non dégénérés. En un point critique d'une fonction : hessienne définie positive minimum local strict; définie négative maximum local strict; indéfinie point de selle. La démonstration repose sur la formule de Taylor avec reste de Young et sur la minoration d'une forme définie positive.
Soit de classe sur , un point critique de avec . Que peut-on conclure?
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Déterminer les points critiques des fonctions suivantes sur et préciser leur nature.
- .
- Étudier les points critiques de et leur nature.
- Soit . Montrer que est un point critique dégénéré, que la restriction de à toute droite passant par y admet un minimum strict, et que pourtant n'a pas de minimum local en .
Déterminer le maximum et le minimum globaux de sur le disque fermé , en précisant en quels points ils sont atteints.
Trois capteurs sont placés aux points , et d'un plan (coordonnées en mètres; disposition fictive). On cherche le point qui minimise
Soit un ouvert, et un minimum local de .
Références
- Douchet, J. et Zwahlen, B., Calcul différentiel et intégral, Presses polytechniques et universitaires romandes, Lausanne (extremums libres et formes quadratiques).
- Stewart, J., Analyse: concepts et contextes, vol. 2, De Boeck, Bruxelles, chap. 11 (valeurs extrêmes, méthode sur un ensemble fermé borné).
- Adams, R. A. et Essex, C., Calculus: A Complete Course, Pearson, Harlow, chap. 13 (extreme values, second derivative test).
- Marsden, J. E. et Tromba, A. J., Vector Calculus, Freeman, New York, chap. 3 (higher-order derivatives, maxima and minima).
- Liret, F. et Martinais, D., Analyse 2e année, Dunod, Paris (points critiques, cas dégénérés et contre-exemples).
- Apostol, T. M., Calculus, vol. 2, Wiley, New York, chap. 9 (nature d'un point stationnaire, conditions du second ordre).