Gradient, dérivées directionnelles et règle de la chaîne
Gradient et lignes de niveau, dérivée directionnelle, règle de la chaîne, matrice jacobienne, coordonnées polaires et accroissements finis.
Objectifs du chapitre
À la fin de ce chapitre, vous serez capable de:
définir la dérivée directionnelle Duf(a) et la calculer, soit par la définition, soit — lorsque f est différentiable — par le produit scalaire ⟨∇f(a),u⟩;
justifier que le gradient indique la direction de plus forte croissance, que sa norme est le taux de croissance maximal, et qu'il est orthogonal aux lignes ou surfaces de niveau;
écrire l'équation du plan tangent à une surface de niveau F(x,y,z)=c et celle de la droite normale;
appliquer la règle de la chaîne sous ses trois formes — le long d'une courbe, pour un changement de paramètres, et sous sa forme générale JG∘F(a)=JG(F(a))JF(a) — et reconnaître qu'elle est un produit de matrices;
passer en coordonnées polaires dans une expression contenant des dérivées partielles, dans les deux sens;
établir la relation d'Euler des fonctions homogènes et l'inégalité des accroissements finis à plusieurs variables, et dire pourquoi l'égalité des accroissements finis tombe en défaut pour une fonction à valeurs vectorielles.
La dérivée directionnelle
Une pente dans une direction choisie
Le chapitre 3 a introduit les dérivées partielles ∂x∂f(a) et ∂y∂f(a): ce sont les pentes du graphe de f le long des deux directions privilégiées que sont les axes. Rien n'oblige pourtant à privilégier ces deux directions. Un randonneur qui quitte un point d'un versant peut partir dans n'importe quelle direction, et la pente qu'il subit dépend de son choix; une sonde qui se déplace sur une plaque chauffée voit la température varier à un taux qui dépend du cap qu'elle suit. C'est cette pente «dans une direction quelconque» que formalise la dérivée directionnelle.
Trois remarques sur cette définition, à lire lentement.
Elle ne fait intervenir qu'une variable. Comme U est ouvert, il existe ε>0 tel que a+tu∈U pour ∣t∣<ε. La fonction d'une variable réelle
g:]−ε,ε[→R,g(t)=f(a+tu)(4.2)
est donc bien définie, et (4.1) dit exactement que Duf(a)=g′(0). La dérivée directionnelle est une dérivée d'Analyse I déguisée: celle de la restriction de f à la droite passant par a et dirigée par u. Toute la théorie d'une variable — accroissements finis, Taylor, règle de dérivation d'un produit — s'y applique, et c'est la stratégie de démonstration la plus rentable du chapitre: pour prouver quelque chose à plusieurs variables, restreindre à une droite et invoquer l'Analyse I.
La normalisation ∥u∥=1 n'est pas décorative. Si l'on remplaçait u par λu avec λ>0, la limite (4.1) serait multipliée par λ (posez s=λt). Une «dérivée directionnelle» calculée avec un vecteur non unitaire n'est donc pas une pente mais une pente multipliée par une longueur arbitraire, et les comparaisons entre directions perdent tout sens. Nous suivons la convention du cours: u est toujours unitaire. En , on écrira souvent , ce qui paramètre toutes les directions par un angle .
Les dérivées partielles en sont un cas particulier. Si ei désigne le i-ième vecteur de la base canonique, alors ei est unitaire et
Réciproquement, D−uf(a)=−Duf(a) dès que l'une des deux existe: faire demi-tour change le signe de la pente, ce qui est la moindre des choses.
Avoir toutes les dérivées directionnelles ne suffit pas
Il serait tentant de définir «dérivable» par «toutes les dérivées directionnelles existent». Le chapitre 3 a déjà montré que l'existence des seules dérivées partielles ne garantit rien — pas même la continuité. On pourrait espérer qu'en exigeant toutes les directions, on obtienne enfin la bonne notion. C'est faux, et c'est important.
Le théorème du gradient
Sous l'hypothèse de différentiabilité, tout rentre dans l'ordre, et de la façon la plus simple possible: une seule formule donne les dérivées directionnelles dans toutes les directions.
Démonstration. Par définition de la différentiabilité (chapitre 3), il existe une fonction ε définie au voisinage de 0, avec ε(h)→0 quand h→0, telle que
f(a+h)=f(a)+⟨∇f(a),h⟩+∥h∥ε(h).
Appliquons-la à h=tu avec t=0 assez petit. Comme ∥tu∥=∣t∣∥u∥=∣t∣ et que le produit scalaire est linéaire en sa seconde variable,
Lorsque t→0, tu→0, donc ε(tu)→0; le facteur sgn(t) est borné par 1, et le second terme tend vers 0. La limite existe et vaut ⟨∇f(a),u⟩.
Remarquez ce que la démonstration exploite: c'est exactement le caractère uniforme du reste — le même ε sert pour toutes les directions u. Dans le premier contre-exemple ci-dessus, chaque droite fournit sa propre pente, mais aucune fonction linéaire ne les recolle.
Reprenons l'exemple 4.1 (a): ∇f=(2xy,x2), donc ∇f(2,1)=(4,4) et Duf(2,1)=⟨(4,4),(53,54)⟩=512+516=528=5,6, comme annoncé — mais sans développer de polynôme.
Ce que le gradient dit de toutes les directions à la fois
La formule (4.4) fait de Duf(a) un produit scalaire, et un produit scalaire est un objet dont on sait tout: l'inégalité de Cauchy–Schwarz suffit à répondre à la question «dans quelle direction f croît-elle le plus vite?».
Démonstration. Écrivons g=∇f(a) et supposons g=0. L'inégalité de Cauchy–Schwarz donne, pour tout u unitaire,
∣Duf(a)∣=∣⟨g,u⟩∣≤∥g∥∥u∥=∥g∥,
avec égalité si et seulement si u et g sont colinéaires; comme u est unitaire, cela impose u=±g/∥g∥. Pour u=g/∥g∥ on obtient ⟨g,u⟩=∥g∥2/∥g∥=∥g∥>0, c'est donc le maximum; pour le vecteur opposé, , le minimum. Le point 3 est la définition de l'orthogonalité: . Enfin si , (4.4) donne directement .
Une formulation équivalente, souvent plus parlante: en écrivant φ l'angle entre u et ∇f(a),
Duf(a)=∥∇f(a)∥cosφ.(4.5)
Le taux de variation dans une direction est donc le taux maximal, «projeté» par un cosinus. En dimension 2, si θg est l'angle polaire de ∇f(a) et u=(cosθ,sinθ), cela s'écrit Duf(a)=∥∇f(a)∥cos(θ−θg): la fonction est une sinusoïde d'amplitude . Tracée en coordonnées polaires, cette relation donne un — c'est la «rose» de l'explorateur de ce chapitre.
Ce théorème est le fondement d'une famille entière d'algorithmes: la méthode de descente de gradient, qui minimise une fonction en se déplaçant à chaque itération dans la direction −∇f, c'est-à-dire, par le point 2, dans la direction de décroissance la plus rapide. Elle apparaît partout, du calage de modèles par moindres carrés à l'apprentissage automatique. Notez d'emblée sa limite: le théorème est une affirmation locale, au premier ordre. La direction de plus forte pente en un point n'est pas la direction du minimum, et rien ne dit qu'avancer longtemps dans cette direction soit une bonne idée — le chapitre 7 y reviendra.
Question 4.1
Une fonction f est différentiable en a et ∇f(a)=(3,−4). Quelle est la plus grande valeur possible de Duf(a) lorsque u parcourt les vecteurs unitaires?
Le gradient et les lignes de niveau
Le gradient est orthogonal aux ensembles de niveau
Le point 3 du théorème 4.2 dit que f ne varie pas, au premier ordre, dans les directions orthogonales à ∇f(a). Ce sont précisément les directions qui «suivent» l'ensemble de niveau. Rendons cela précis.
Rappelons la notion du chapitre 2: pour c∈R, l'ensemble de niveauc de f est Γc={x∈U:f(x)=c}. En dimension on parle de (une courbe du plan), en dimension de .
Démonstration. Posons h(t)=f(γ(t)). Par hypothèse h est la fonction constante c, donc h′(0)=0. Par ailleurs, la règle de la chaîne le long d'une courbe (théorème 4.4, démontré plus bas et indépendant de ce qui précède) donne h′(t)=⟨∇f(γ(t)),γ′(t)⟩, d'où .
L'ordre d'exposition est ici un peu inconfortable — nous utilisons un théorème énoncé plus loin —, mais la logique est saine: le théorème 4.4 ne dépend que du théorème 4.1. Vous pouvez aussi lire la démonstration ainsi: le long d'une courbe de niveau, f ne varie pas; sa dérivée le long de cette courbe est donc nulle; or cette dérivée est un produit scalaire avec le gradient.
Le théorème 4.3 a une portée exactement mesurée: il dit que ∇f(a) est orthogonal à toutes les directions tangentes à Γc en a. Pour en déduire que «∇f(a) est normal à Γc», il faut encore savoir que Γc possède, près de , un espace tangent de la bonne dimension — autrement dit qu'elle est bien une courbe (en dimension 2) ou une surface (en dimension 3). C'est précisément ce que garantira le du chapitre 6, sous l'hypothèse . Quand le gradient s'annule, l'ensemble de niveau peut cesser d'être une courbe: pour , la ligne de niveau est la réunion des deux droites , qui se croisent en — et c'est bien en que s'annule.
Lecture sur une carte topographique
Une carte au 1:25000 de l'Office fédéral de topographie porte des courbes de niveau, tracées ici tous les 20 m d'altitude. Ce sont les lignes de niveau de la fonction «altitude» h(x,y). Le théorème 4.3 donne alors trois règles de lecture que tout randonneur connaît sans les avoir démontrées.
La ligne de plus grande pente coupe les courbes de niveau à angle droit. C'est (4.6). Un torrent, qui suit la plus grande pente, descend perpendiculairement aux courbes de niveau.
Là où les courbes sont serrées, la pente est forte. Si deux courbes de niveau consécutives sont distantes de Δh=20 m en altitude et de Δs en distance horizontale mesurée perpendiculairement, alors ∥∇h∥≈Δh/Δs. Sur la carte, Δs=8 mm entre deux courbes correspond à 200 m sur le terrain, donc à une pente de 20/200=10%; mm correspond à m et à une pente de . Le resserrement des courbes la norme du gradient.
Ces trois règles ne sont pas des analogies: ce sont les trois énoncés du théorème 4.2 traduits en français.
Exemple fil rouge: la plaque chauffée
Question 4.2
Sur la même plaque T(x,y)=100−10x2−5y2, calculez la dérivée directionnelle DuT au point (1,2) dans la direction u=(0,6;−0,8), en °C/m.
Explorateur 4.1 · Rose des dérivées directionnelles
Plaque chauffée T(x, y) = 100 − 10x² − 5y² (modèle didactique, en °C, coordonnées en mètres). Déplacez le point a sur la plaque et faites tourner la direction u = (cos θ, sin θ). À droite, la courbe polaire r(θ) = D_u T(a) est un cercle passant par l'origine dont le diamètre vaut exactement ‖∇T(a)‖: tourner θ déplace le repère sur le cercle, mais ne change pas le cercle.
Abscisse a11,0m
Ordonnée a21,0m
Angle θ de la direction u60°
Température T(a)
85,0°C
Norme du gradient ‖∇T(a)‖
22,36°C/m
Direction de plus forte pente
207°
Dérivée directionnelle DuT(a)
−18,66°C/m
Rapport DuT / ‖∇T‖ = cos(θ − θg)
−0,835
Diamètre du cercle de la rose
22,36°C/m
Plan tangent à une surface de niveau
En dimension 3, le théorème 4.3 fournit l'outil qui manquait pour écrire l'équation d'un plan tangent à une surface définie implicitement, c'est-à-dire par une équation F(x,y,z)=c plutôt que par un graphe z=f(x,y).
Cette définition est justifiée par le théorème 4.3: tout vecteur tangent en a à une courbe tracée sur S est orthogonal à ∇F(a), donc appartient au plan (4.7). L'hypothèse ∇F(a)=0 est indispensable — sans elle, (4.7) devient 0=0, qui n'est pas l'équation d'un plan. Les points où ∇F s'annule sont les points singuliers de la surface: le cône x2+y2−z2=0 n'a pas de plan tangent à sa pointe, et c'est bien là que s'annule.
Question 4.3
Quel est un vecteur normal à la surface x2−y2+z=5 au point (3,2,0)?
La règle de la chaîne
La règle de dérivation des fonctions composées d'Analyse I, (f∘g)′(t)=f′(g(t))g′(t), se généralise à plusieurs variables. Nous la présentons en trois étages de généralité croissante, parce que c'est dans cet ordre qu'on l'utilise — mais il faut savoir dès maintenant que les trois formes sont une seule et même formule: celle du produit de deux matrices jacobiennes.
Premier étage: le long d'une courbe
Démonstration. Posons k(t)=r(t)−a pour t voisin de t0; par dérivabilité de r en t0, k(t)=(t−t0)r′(t0)+(t−t0)η(t) avec quand . En particulier . La différentiabilité de en s'écrit
Le premier terme vaut ⟨∇f(a),r′(t0)+η(t)⟩, qui tend vers ⟨∇f(a),r′(t0)⟩ par continuité du produit scalaire. Dans le second, est borné au voisinage de (il tend vers ), et : le produit tend vers . La limite existe et vaut (4.8).
Deux lectures de (4.8) méritent d'être retenues.
Lecture cinématique. Si r(t) est la position d'un mobile et f une grandeur scalaire du champ (température, pression, altitude, potentiel), alors h(t)=f(r(t)) est la grandeur ressentie par le mobile et (4.8) donne son taux de variation: c'est le produit scalaire du gradient du champ par le vecteur vitesse. Un mobile rapide voit varier vite; un mobile qui se déplace perpendiculairement au gradient ne voit rien varier.
Lecture «dérivée directionnelle fois vitesse». En écrivant r′(t0)=∥r′(t0)∥u avec u unitaire (si r′(t0)=0), (4.8) devient
dtdf(r(t))t0=∥r′(t0)∥Duf(r(t0)).(4.9)
La dérivée directionnelle est le taux de variation par unité de longueur parcourue (en °C/m pour la plaque); la dérivée composée est le taux par unité de temps (en °C/s). Le facteur de conversion est la vitesse scalaire, en m/s. Confondre les deux est une faute d'unités.
Deuxième étage: un changement de paramètres
Le cas suivant est celui qui sert dans les changements de variables: la fonction f dépend de x et y, qui dépendent eux-mêmes de deux nouveaux paramètres u et v.
Démonstration. Il suffit d'appliquer le théorème 4.4. Pour la première formule, fixons v=v0 et considérons la courbe t↦r(t)=(x(t,v0),y(t,v0)), dérivable en de vecteur vitesse . Comme , (4.8) donne
Le calcul pour ∂z/∂v est identique, en fixant u=u0. □
Troisième étage: la règle de la chaîne est un produit de matrices
Les deux formes précédentes sont des cas particuliers d'un seul énoncé, qui a le mérite de rendre la structure évidente. Rappelons du chapitre 3 que pour F=(F1,…,Fm):V⊂Rp→Rm différentiable en , la est la matrice dont le coefficient est : ses lignes sont les gradients transposés des composantes.
Esquisse de démonstration. Écrivons L=dFa et M=dGb, applications linéaires. La différentiabilité de F en a donne F(a+h)=b+L(h)+∥h∥ε1(h) avec ; notons , de sorte que au voisinage de , où est la norme d'opérateur de . Celle de en donne . En composant,
Le reste vérifie ∥R(h)∥≤∥h∥∥M∥∥ε1(h)∥+C∥h∥∥ε2(k(h))∥, donc ∥R(h)∥/∥h∥→0 puisque quand . Ainsi est différentiable en de différentielle , et la matrice d'une composée d'applications linéaires est le produit des matrices.
Question 4.4
Ordonnez les étapes du calcul d'une dérivée composée par la règle de la chaîne.
Glissez les éléments pour les mettre dans le bon ordre
1.
Identifier les variables indépendantes, les variables intermédiaires et la fonction extérieure, puis dessiner l'arbre des dépendances
2.
Calculer les dérivées partielles de la fonction extérieure, et les évaluer au POINT IMAGE
3.
Calculer les dérivées des variables intermédiaires par rapport aux variables indépendantes, au point de départ
4.
Vérifier les hypothèses: la fonction extérieure est différentiable au point image, les fonctions intermédiaires sont dérivables au point de départ
5.
Exprimer le résultat dans les variables demandées et le contrôler sur un cas où la composée se calcule directement
6.
Multiplier les dérivées le long de chaque chemin de l'arbre, puis additionner les chemins qui aboutissent à la même variable indépendante
Question 4.5
Soient z=x2y avec x=u2+v2 et y=uv. Calculez ∂v∂z au point (u,v)=(2,1).
Le passage en coordonnées polaires
Les formules dans les deux sens
Le changement de coordonnées polaires est le changement de variables le plus utilisé du cours: il intervient au chapitre 6 (inversion locale), au chapitre 9 (intégrales doubles) et au chapitre 10 (coordonnées cylindriques et sphériques). Il est aussi le meilleur exercice d'application du théorème 4.5.
Posons P(r,θ)=(rcosθ,rsinθ), de sorte que x=rcosθ et y=rsinθ. Sa matrice jacobienne est
On peut retrouver (4.14) sans matrice: multiplier la première équation de (4.13) par cosθ, la seconde par −sinθ/r, et additionner. Les deux méthodes donnent bien sûr le même résultat; la matricielle est plus sûre dès que le nombre de variables augmente.
Fonctions homogènes et relation d'Euler
Certaines fonctions ont un comportement simple sous les changements d'échelle. Elles sont omniprésentes en physique — les grandeurs extensives doublent quand le système double — et en économie — les rendements d'échelle.
Exemples: un polynôme dont tous les monômes ont le même degré total k est homogène de degré k — ainsi f(x,y)=x3+2xy2 est homogène de degré 3, et f(x,y)=x2+y n'est homogène d'aucun degré. La norme est homogène de degré ; est homogène de degré (elle ne dépend que de la direction); est homogène de degré sur , ce qui est le potentiel newtonien.
Démonstration.(Condition nécessaire.) Fixons x∈U et posons ψ(t)=f(tx) pour t>0; c'est la composée de t↦tx (de dérivée constante x) et de f, donc, par le théorème 4.4, est dérivable et . Si est homogène de degré , alors , donc . En égalant les deux expressions et en prenant , on obtient .
(Condition suffisante.) Supposons (4.18) vraie partout sur U et fixons x∈U. Posons, pour t>0,
χ(t)=tkf(tx)=t−kψ(t).
Alors χ est dérivable et χ′(t)=t−kψ′(t)−kt−k−1ψ(t)=t−k−1[tψ′(t)−kψ(t)]. Or , qui vaut en appliquant (4.18) au point . Donc pour tout , et est constante sur l'intervalle (chapitre 8 d'Analyse I). Comme , on a pour tout .
Vérification sur un exemple: f(x,y)=x3+2xy2 est homogène de degré 3, ∇f=(3x2+2y2,4xy) et
Au point (1,2): f=1+8=9, ∇f=(3+8,8)=(11,8), et ⟨(11,8),(1,2)⟩=11+16=27=3×9.
L'inégalité des accroissements finis
À une variable, le théorème des accroissements finis (Analyse I, chapitre 8) affirme l'existence d'un point c entre a et b tel que f(b)−f(a)=f′(c)(b−a). À plusieurs variables, il faut d'abord préciser le long de quoi on se déplace — d'où l'hypothèse de convexité.
Démonstration. Posons v=b−a et
g(t)=f(a+tv),t∈[0,1],
bien définie puisque C est convexe. Par le théorème 4.4, g est dérivable sur [0,1] avec g′(t)=⟨∇f(a+tv),v⟩, et elle est continue sur [0,1]. Le théorème des accroissements finis d'Analyse I fournit tel que
Si ∇f≡0, le majorant est nul, donc f(b)=f(a) pour tous a,b d'une même boule; sur un ouvert connexe, on relie deux points par une chaîne finie de boules et l'on conclut. □
Application: une grandeur d'état qui varie dans le temps
Voici, entièrement chiffrée, la situation d'ingénierie la plus courante où la règle de la chaîne est indispensable: une grandeur dépend de plusieurs paramètres, et tous varient simultanément.
Synthèse
La dérivée directionnelleDuf(a)=limt→0tf(a+tu)−f(a), avec , est la dérivée en de la restriction de à la droite . Son existence dans les directions n'entraîne ni la différentiabilité () ni même la continuité ().
Série d'exercices du chapitre 4Exercice 1 sur 5
Question 4.6
Soit f différentiable en a avec ∇f(a)=0. Pour combien de directions unitaires u de R2 a-t-on Duf(a)=0?
Exercices
Vous pouvez afficher le corrigé directement sous chaque énoncé après avoir cherché la solution.
Exercice 4.1 · Dérivées directionnelles
Soit f(x,y)=x2+xy+y2. Calculer Duf(1,2) pour .
Exercice 4.2 · Gradient, lignes de niveau et plans tangents
Déterminer l'équation de la tangente à la ligne de niveau de f(x,y)=x2−y2 passant par le point (2,1).
Déterminer l'équation du plan tangent à l'ellipsoïde x2+2y2+3z2=6 au point , ainsi que celle de la droite normale.
Exercice 4.3 · Règle de la chaîne
Soient w=x2+y2+z2 et r(t)=(cost,sint,t) (une hélice). Calculer de deux manières.
Exercice 4.4 · Coordonnées polaires
Soit f de classe C1 sur R2∖{0} et f~(r,θ)=f(rcosθ,rsinθ). Démontrer la formule (4.16): .
Exercice 4.5 · Fonctions homogènes et accroissements finis
Soit f de classe C1 et homogène de degré k sur un cône ouvert U⊂Rn. Montrer que chaque dérivée partielle ∂f/∂xj est homogène de degré .
Références
Douchet, J. et Zwahlen, B., Calcul différentiel et intégral, Presses polytechniques et universitaires romandes, Lausanne (gradient, dérivées directionnelles et composition).
Stewart, J., Analyse: concepts et contextes, vol. 2, De Boeck, Bruxelles, chap. 11 (dérivées directionnelles, gradient, plans tangents).
Adams, R. A. et Essex, C., Calculus: A Complete Course, 9e éd., Pearson, Toronto, chap. 12.
Marsden, J. E. et Tromba, A. J., Vector Calculus, 6e éd., Freeman, New York, chap. 2 (règle de la chaîne sous forme matricielle).
Liret, F. et Martinais, D., Analyse 2e année, Dunod, Paris (fonctions homogènes, relation d'Euler et accroissements finis).
Apostol, T. M., Calculus, vol. 2, 2e éd., Wiley, New York, chap. 8 (contre-exemples sur les dérivées directionnelles).
unitaire
∥u∥=1
dérivée directionnelle
f
a
u
Duf(a)=t→0limtf(a+tu)−f(a),(4.1)
lorsque cette limite existe. C'est un nombre réel.
R2
u=(cosθ,sinθ)
θ∈[0,2π[
∥u∥2=259+2516=1
g(t)=f(2+53t,1+54t)=(2+53t)2(1+54t),
et en développant, g(t)=4+(512+516)t+O(t2)=4+528t+O(t2). Donc Duf(2,1)=g′(0)=528=5,6. Nous retrouverons ce nombre en une ligne dès que le théorème 4.1 sera établi.
(b) Soit f(x,y)=∣x∣+∣y∣ et a=(0,0). Pour u=(cosθ,sinθ),
La limite à droite vaut ∣cosθ∣+∣sinθ∣>0 et la limite à gauche son opposé: aucune dérivée directionnelle n'existe en 0. La fonction est pourtant continue partout. On reconnaît, à plusieurs variables, le comportement de x↦∣x∣ en 0.
Comme x2≤x2+y2, on a ∣f(x,y)∣≤∣x∣≤∥(x,y)∥, donc f est continue en 0. Pour u=(cosθ,sinθ) et t=0,
tf(tu)−f(0)=t1⋅t2t3cos3θ=cos3θ,
quantité indépendante de t: la limite existe et Duf(0)=cos3θ. Toutes les dérivées directionnelles existent. En particulier ∇f(0)=(1,0), obtenu pour θ=0 et θ=π/2. Si f était différentiable en 0, le théorème 4.1 ci-dessous donnerait Duf(0)=⟨(1,0),u⟩=cosθ. Or pour θ=π/4, cos3θ=42≈0,354 tandis que cosθ≈0,707: f n'est pas différentiable en 0. Le défaut se lit directement sur la formule: l'application u↦Duf(0) n'est pas linéaire en u, alors que la différentielle, elle, est par définition une application linéaire.
Second contre-exemple, discontinu. La fonction du chapitre 2,
g(x,y)=x4+y2x2ypour (x,y)=(0,0),g(0,0)=0,
vérifie, pour u=(cosθ,sinθ) avec sinθ=0,
tg(tu)=t2cos4θ+sin2θcos2θsinθt→0sinθcos2θ,
et la limite vaut 0 si sinθ=0. Toutes les dérivées directionnelles existent donc en 0. Pourtant g n'y est même pas continue: le long de la parabole y=x2, g(x,x2)=2x4x4=21 pour tout x=0, alors que g(0)=0.
Morale. «Toutes les dérivées directionnelles existent» est une information directionnelle: elle ne contrôle le comportement de f que le long de droites, et une fonction de deux variables peut faire n'importe quoi entre les droites. La différentiabilité, elle, est une approximation uniforme en la direction — c'est le o(∥h∥) du chapitre 3, où h tend vers 0de n'importe quelle façon. Ne dites jamais «f est dérivable» pour une fonction de plusieurs variables: dites «différentiable», ou «de classe C1».
En particulier, l'application u↦Duf(a) est la restriction à la sphère unité d'une application linéaire.
□
maximale
∥∇f(a)∥
u=∥∇f(a)∥∇f(a)
Duf(a) est minimale, égale à −∥∇f(a)∥, pour la seule direction opposée u=−∥∇f(a)∥∇f(a);
Duf(a)=0 si et seulement si u est orthogonal à ∇f(a).
Si ∇f(a)=0, alors Duf(a)=0 pour toute direction u: le point est critique et aucune direction ne se distingue au premier ordre.
−∥g∥
⟨g,u⟩=0
g=0
Duf(a)=0
□
θ↦Duf(a)
∥∇f(a)∥
cercle passant par l'origine, de diamètre ∥∇f(a)∥
Figure 4.1. La dérivée directionnelle comme pente d'une coupe verticale. En haut, la surface z = f(x, y) = 4 − x²/2 − y²/4, coupée par le plan vertical qui contient le point a = (−1, −1) et la direction u = (1, 1)/√2; la trace de la surface dans ce plan est la courbe de section, en couleur. En bas, la même section vue dans son plan: c'est le graphe de g(t) = f(a + tu), une parabole. La tangente en t = 0, en bleu, a pour pente g′(0) = Dᵤ f(a) ≈ 1,06: elle monte de 1,06 unité quand t avance de 1.
2
ligne de niveau
3
surface de niveau
tracée dans l'ensemble de niveau
f(γ(t))=c
t
γ(0)=a
⟨∇f(a),γ′(0)⟩=0.(4.6)
Autrement dit, ∇f(a) est orthogonal à tout vecteur tangent en a à une courbe tracée dans Γc.
0=h′(0)=⟨∇f(a),γ′(0)⟩
□
a
théorème des fonctions implicites
∇f(a)=0
f(x,y)=x2−y2
0
y=±x
0
0
∇f=(2x,−2y)
Figure 4.2. Lignes de niveau de f(x, y) = x² + 2y² pour les valeurs c = 1, 2, …, 6 (en bleu), et le gradient ∇f(x, y) = (2x, 4y) en huit points (les flèches). Chaque flèche est perpendiculaire à la courbe qu'elle touche — le petit carré marque l'angle droit formé avec la tangente sur la courbe c = 3 — et pointe vers les valeurs croissantes, donc vers l'extérieur. Sa longueur est proportionnelle à ‖∇f‖: les flèches sont les plus longues près de l'axe vertical, là où des niveaux également espacés produisent des courbes les plus serrées.
Δs=2
50
40%
est
Marcher à flanc de coteau, c'est suivre une courbe de niveau. Le sentier ne monte ni ne descend: Duh=0, et le point 3 du théorème 4.2 dit que cette direction est orthogonale au gradient.
C'est un modèle didactique: la fonction T n'est pas solution de l'équation de la chaleur (son laplacien vaut −30, pas 0), mais elle en a le comportement qualitatif — un coin chaud en (0,0) à 100°C, un coin froid en (2,2) à T(2,2)=100−40−20=40°C — et elle se calcule à la main.
Gradient.∇T(x,y)=(−20x,−10y). Au point a=(1,1), où T=100−10−5=85°C:
c'est-à-dire vers le coin chaud, avec un taux de 22,4°C/m. La direction de refroidissement le plus rapide est l'opposée, (0,894;0,447), de taux −22,4°C/m.
Direction isotherme. Les directions dans lesquelles la température ne varie pas (au premier ordre) sont les deux directions orthogonales à ∇T(1,1), soit ±(51,−52)≈±(0,447;−0,894). Vérification: ⟨(−20,−10),(0,447;−0,894)⟩=−8,944+8,944=0. Ce sont les tangentes à l'isotherme T=85, c'est-à-dire à l'ellipse 10x2+5y2=15.
Une direction quelconque. Pour u=21(1,1) (vers le coin froid, à 45°):
DuT(1,1)=2−20−10=−230=−152≈−21,2°C/m.
C'est 94,9% du refroidissement maximal: la diagonale n'est pas tout à fait la direction de plus forte pente, parce que la plaque est plus sensible à x qu'à y.
La droite normale en a est la droite passant par a et dirigée par ∇F(a), de représentation paramétrique x=a+s∇F(a), s∈R.
∇F=(2x,2y,−2z)
0
F(x,y,z)=f(x,y)−z
∇F=(∂x∂f,∂y∂f,−1)
∂x∂f(x−a)+∂y∂f(y−b)−(z−f(a,b))=0
(∂x∂f,∂y∂f,−1)
S
1+4+9=14
F(x,y,z)=x2+y2+z2
∇F=(2x,2y,2z)
∇F(a)=(2,4,6)
2(x−1)+4(y−2)+6(z−3)=0⟺2x+4y+6z=28⟺x+2y+3z=14.
On retrouve un fait élémentaire de géométrie: le plan tangent à une sphère centrée en 0 est orthogonal au rayon, car ∇F(a)=2a est colinéaire au rayon. La droite normale est x=(1,2,3)+s(2,4,6), c'est-à-dire la droite passant par le centre.
(b) Ellipsoïde. Soit E:x2+4y2+9z2=14 et le point a=(1,1,1), qui vérifie 1+4+9=14. Ici ∇F=(2x,8y,18z), donc ∇F(1,1,1)=(2,8,18) et le plan tangent est
2(x−1)+8(y−1)+18(z−1)=0⟺x+4y+9z=14.
Cette fois la normale (2,8,18) n'est pas colinéaire à (1,1,1): sur un ellipsoïde, la normale ne passe pas par le centre. Sa norme vaut 4+64+324=392=142≈19,80, et le vecteur normal unitaire est 1421(2,8,18)=721(1,4,9)≈(0,101;0,404;0,909).
(c) Un graphe traité comme surface de niveau. La surface z=xy (une selle) passe par (2,3,6). En posant F(x,y,z)=xy−z, ∇F=(y,x,−1) vaut (3,2,−1) en ce point, et le plan tangent est 3(x−2)+2(y−3)−(z−6)=0, soit 3x+2y−z=6. Vérification sur le point: 6+6−6=6. On aurait pu appliquer directement la formule du chapitre 3, avec ∂x∂f=y=3 et ∂y∂f=x=2: z=6+3(x−2)+2(y−3), la même équation.
À t=0: dtdT=−3°C/s. À t=5 s, la sonde est en (2;0,5), où T=100−40−1,25=58,75°C, et le refroidissement s'est accéléré: −7,5°C/s.
Vérification directe.T(r(t))=100−10(1+0,2t)2−5(1−0,1t)2=85−3t−0,45t2, dont la dérivée est bien −3−0,9t. C'est le contrôle à faire systématiquement quand la composée se calcule explicitement.
Contrôle par (4.9). La direction de la vitesse est u=0,2236(0,2;−0,1)≈(0,8944;−0,4472), et
Alors ∥r′∥DuT=0,2236×(−13,416)=−3,000°C/s: les deux calculs concordent. Notez que −13,4 est loin du minimum possible −22,4: la sonde ne suit pas la ligne de plus grande pente.
Contrôle direct: f(r(t))=cos2tsint, dont la dérivée est −2costsin2t+cos3t. Identique. En t=π/4, on a cos3(π/4)=42≈0,3536 et 2cos(π/4)sin2(π/4)=2⋅22⋅21=22≈0,7071, donc la dérivée vaut −42≈−0,354.
Comme r parcourt le cercle unité, ∥r′(t)∥=1 et (4.9) dit que cette valeur est aussi la dérivée directionnelle de f au point (22,22) dans la direction tangente au cercle.
où les dérivées de f sont évaluées au point image F(u0,v0) et celles de x et y en (u0,v0).
t=u0
r′(u0)=(∂u∂x(u0,v0),∂u∂y(u0,v0))
z(t,v0)=f(r(t))
Figure 4.3. Arbre des dépendances de la composition z = f(x, y) avec x = x(u, v) et y = y(u, v). Chaque branche porte la dérivée partielle qu'elle transporte. Les deux branches en couleur sont les deux chemins qui mènent de z à u: la dérivée ∂z/∂u s'obtient en multipliant les dérivées le long de chaque chemin, puis en additionnant les chemins. C'est la traduction visuelle des formules (4.10); pour v, on lit les deux chemins restants.
C'est lourd, mais c'est ce que la formule dit vraiment: les dérivées de f sont évaluées au point image, pas au point de départ. Une erreur classique consiste à écrire ∂x∂f(u,v), ce qui n'a aucun sens.
Identique. Application numérique en (u,v)=(1,2): alors x=5, y=2, z=25×2=50, et
∂u∂z(1,2)=2×5×9=90,∂v∂z(1,2)=1×5×21=105.
La substitution est ici possible parce que la composée se simplifie. Dans la plupart des situations utiles — f inconnue, ou définie par une table, ou solution d'une équation — elle ne l'est pas, et la règle de la chaîne est le seul accès aux dérivées de la composée. C'est tout l'intérêt de (4.10).
a
matrice jacobienne
JF(a)
m×p
(i,j)
∂xj∂Fi(a)
a∈V
G:U→Rq
b=F(a)
G∘F:V→Rq
a
d(G∘F)a=dGb∘dFa,
et, matriciellement,
JG∘F(a)=JG(F(a))JF(a),(4.11)
produit d'une matrice q×m par une matrice m×p, qui est bien de taille q×p.
ε1(h)→0
k(h)=L(h)+∥h∥ε1(h)
∥k(h)∥≤(∥L∥+∥ε1(h)∥)∥h∥≤C∥h∥
0
∥L∥
L
G
b
G(b+k)=G(b)+M(k)+∥k∥ε2(k)
k(h)→0
h→0
G∘F
a
M∘L
□
r′
G=f
Jf
∇fT
×
p=2, m=2, q=1: Jf=(∂x∂f∂y∂f) et JF=(∂x/∂u∂y/∂u∂x/∂v∂y/∂v), et le produit est la ligne (∂z/∂u∂z/∂v) de (4.10).
Le déterminant est multiplicatif, donc pour p=m=q: detJG∘F(a)=detJG(F(a))⋅detJF(a). C'est la relation qui gouvernera les changements de variables dans les intégrales multiples (chapitres 9 et 10) et l'inversion locale (chapitre 6): en particulier, si G=F−1, alors JF−1(F(a))=(JF(a))−1.
R2
R2
JF(u,v)=(2u101),JG(x,y)=(y1x1).
Au point (u,v)=(1,2), l'image est (x,y)=(1,3), donc
JG(1,3)JF(1,2)=(3111)(2101)=(7311).
Contrôle direct.G(F(u,v))=(u2(u+v),u2+u+v)=(u3+u2v,u2+u+v), dont la jacobienne est (3u2+2uv2u+1u21), soit (7311) en (1,2). Les deux coïncident.
Déterminants.detJF(1,2)=2, detJG(1,3)=3−1=2 et detJG∘F(1,2)=7−3=4=2×2: la multiplicativité est vérifiée. Géométriquement, F dilate les aires d'un facteur 2 au voisinage de (1,2), G d'un facteur 2 au voisinage de (1,3), et la composée d'un facteur 4.
et (4.14) n'est rien d'autre que la décomposition de ∇f dans cette base orthonormée:
∇f=∂r∂f~er+r1∂θ∂f~eθ.(4.15)
Deux conséquences immédiates. D'abord la norme:
∥∇f∥2=(∂r∂f~)2+r21(∂θ∂f~)2.(4.16)
Ensuite l'origine du facteur 1/r, qui surprend toujours: θ n'est pas une longueur. Un accroissement dθ correspond à un déplacement de longueur rdθ sur le terrain, d'autant plus grand qu'on est loin du centre. Le taux de variation par unité de longueur dans la direction orthoradiale est donc r1∂θ∂f~, et pas ∂θ∂f~. C'est le même facteur qui réapparaîtra sous la forme rdrdθ au chapitre 9.
∂r∂f~=2r
∂θ∂f~=0
∂x∂f=2rcosθ=2x
∂y∂f=2rsinθ=2y
f(x,y)=φ(r)
r=∥(x,y)∥
∇f=φ′(r)er
(b) L'angle polaire lui-même. Sur le demi-plan x>0, la fonction f(x,y)=arctan(y/x) vaut exactement θ, donc f~(r,θ)=θ, ∂r∂f~=0 et ∂θ∂f~=1. Par (4.14),
Contrôle direct: ∂x∂arctan(y/x)=1+y2/x2−y/x2=x2+y2−y. Identique. Au point (1,1), où r=2 et θ=π/4: ∇f(1,1)=(−21,21), de norme 21. La formule (4.16) donne ∥∇f∥2=0+21⋅1=21: même valeur. Le gradient est orthoradial, ce qui est normal puisque les lignes de niveau de l'angle sont les demi-droites issues de l'origine.
tx∈U
homogène de degré k
f(tx)=tkf(x)pour tous x∈U et t>0.(4.17)
∥x∥
1
x2+y2x2−y2
0
∥x∥1
−1
R3∖{0}
ψ
ψ′(t)=⟨∇f(tx),x⟩
f
k
ψ(t)=tkf(x)
ψ′(t)=ktk−1f(x)
t=1
⟨∇f(x),x⟩=kf(x)
tψ′(t)=⟨∇f(tx),tx⟩
kf(tx)=kψ(t)
tx∈U
χ′(t)=0
t>0
χ
]0,+∞[
χ(1)=f(x)
f(tx)=tkf(x)
t>0
□
Elle est homogène de degré k=α+β, car F(tK,tL)=AtαKαtβLβ=tα+βF(K,L). Le degré porte un nom: α+β=1 signifie des rendements d'échelle constants (doubler tous les facteurs double la production), α+β>1 des rendements croissants, α+β<1 des rendements décroissants.
La relation d'Euler s'écrit ici
K∂K∂F+L∂L∂F=(α+β)F(K,L).
Les dérivées partielles ∂F/∂K et ∂F/∂L sont les productivités marginales des deux facteurs. En rendements constants (α+β=1), la relation devient KFK+LFL=F: si chaque facteur est rémunéré à sa productivité marginale, la production est exactement épuisée par la rémunération des facteurs, sans reste. C'est le «théorème de l'épuisement du produit» (Wicksteed, 1894), et il est remarquable que ce résultat de théorie économique ne soit rien d'autre que la relation d'Euler.
Application numérique (données fictives, choisies pour tomber juste). Prenons A=10, α=41, β=43, K=81 et L=256 unités. Alors K1/4=3 et L3/4=43=64, donc
F=10×3×64=1920 uniteˊs.
Les productivités marginales valent FK=αF/K=41⋅1920/81=480/81≈5,926 et FL=βF/L=43⋅1920/256=1440/256=5,625. Contrôle d'Euler:
KFK+LFL=81×81480+256×2561440=480+1440=1920=F.
La somme se décompose en 480 pour le capital (25%) et 1440 pour le travail (75%): les exposants α et β sont exactement les parts des facteurs dans la valeur produite. On vérifie enfin les rendements constants: F(162,512)=10×1621/4×5123/4=3840=2F.
En physique, le même théorème sert autrement: une grandeur extensive (énergie interne, entropie, volume) est homogène de degré 1 en les quantités de matière, et la relation d'Euler y donne les relations de Gibbs–Duhem.
C
Rn
c∈]a,b[
f(b)−f(a)=⟨∇f(c),b−a⟩
par conséquent,
∣f(b)−f(a)∣≤(x∈[a,b]sup∥∇f(x)∥)∥b−a∥.(4.19)
En particulier, si ∥∇f∥≤M sur C, alors f est lipschitzienne de constante M sur C; et si ∇f≡0 sur C connexe, f est constante.
Avec ∥b−a∥=0,01+0,01=0,1414, l'inégalité (4.19) majore l'écart par 4,776×0,1414≈0,675. Valeur exacte: f(b)−f(a)=1,21×2,1−2=2,541−2=0,541. Le majorant est respecté et raisonnablement serré, l'écart venant de ce que ∇f(c) et b−a ne sont pas colinéaires. C'est le mécanisme de la propagation des erreurs: une incertitude ∥Δx∥ sur les entrées produit une incertitude au plus sup∥∇f∥⋅∥Δx∥ sur la sortie, et le gradient mesure la sensibilité du modèle.
F(b)−F(a)=F′(τ)(b−a)
Le contre-exemple classique est la paramétrisation du cercle:
γ(t)=(cost,sint),t∈[0,2π].
D'une part γ(2π)−γ(0)=(1,0)−(1,0)=(0,0). D'autre part γ′(t)=(−sint,cost) vérifie ∥γ′(t)∥=1 pour tout t: la dérivée ne s'annule jamais. Il n'existe donc aucun τ∈]0,2π[ tel que 0=γ′(τ)⋅2π. La raison est géométrique: chaque composante a bien son propre point τi (ici τ1=π pour le cosinus et τ2=π/2 ou 3π/2 pour le sinus), mais rien ne force ces points à coïncider, et l'égalité vectorielle exigerait un point commun.
Ce qui survit, c'est l'inégalité. Pour F:[a,b]→Rm de classe C1, on a toujours
∥F(b)−F(a)∥≤(t∈[a,b]sup∥F′(t)∥)(b−a),
qui se démontre en écrivant F(b)−F(a)=∫abF′(t)dt et en majorant. Sur le cercle, elle donne 0≤2π: vraie, et parfaitement inutile — ce qui est normal, puisque la courbe revient à son point de départ après avoir parcouru une longueur 2π. Retenez la règle: à valeurs vectorielles, l'inégalité oui, l'égalité non. La même prudence vaut pour la formule de Taylor avec reste de Lagrange, qui ne se transpose pas telle quelle aux fonctions vectorielles.
On mesure, autour de l'instant considéré, une montée en température et une compression toutes deux affines:
T(t)=300+2t(K),V(t)=0,0200−0,0002t(m3),t en secondes.
Question. À quelle vitesse la pression varie-t-elle à l'instant t=10 s?
État à t=10 s.T=300+20=320 K et V=0,0200−0,002=0,0180 m³ (soit 18,0 litres). La pression vaut
Les deux effets vont dans le même sens — chauffer et comprimer augmentent tous deux la pression — et la compression contribue ici pour 64% de la hausse.
Contrôle par la dérivée logarithmique. Comme lnp=ln(nR)+lnT−lnV, on a p1dtdp=TT′−VV′, ce qui est la règle de la chaîne appliquée à lnp. Numériquement,
et p×0,017361=73902×0,017361=1283,0 Pa/s. Les deux méthodes donnent le même nombre; la seconde a l'avantage de séparer les contributions relatives et de faire disparaître les constantes.
Notez que dp/dt n'est pas une dérivée directionnelle: (T,V) n'est pas un espace métrique dans lequel ∥(ΔT,ΔV)∥ aurait un sens physique, puisque les deux coordonnées n'ont pas la même unité. La dérivée directionnelle demande une norme; la règle de la chaîne, non. C'est pourquoi (4.8) est plus générale que (4.9).
∥u∥=1
0
f
t↦a+tu
toutes
x3/(x2+y2)
x2y/(x4+y2)
Si f est différentiable en a, alors Duf(a)=⟨∇f(a),u⟩=∥∇f(a)∥cosφ. Le maximum ∥∇f(a)∥ est atteint pour u=∇f/∥∇f∥, le minimum −∥∇f(a)∥ pour la direction opposée, et Duf=0 exactement lorsque u⊥∇f(a).
Le gradient est orthogonal aux ensembles de niveau: si f(γ(t))=c, alors ⟨∇f(γ(0)),γ′(0)⟩=0. En dimension 3, cela donne le plan tangent à la surface F=c: ⟨∇F(a),x−a⟩=0, avec ∇F(a)=0.
La règle de la chaîne a trois visages qui n'en font qu'un: dtdf(r(t))=⟨∇f(r(t)),r′(t)⟩; ∂u∂z=∂x∂f∂u∂x+∂y∂f∂u∂y (on multiplie le long d'un chemin, on additionne les chemins); et, en général, JG∘F(a)=JG(F(a))JF(a) — un produit de matrices, dont les déterminants se multiplient.
En coordonnées polaires, ∂rf~=cosθ∂xf+sinθ∂yf et ∂θf~=−rsinθ∂xf+rcosθ∂yf, la relation s'inversant pour r=0; de façon équivalente ∇f=∂rf~er+r1∂θf~eθ, d'où ∥∇f∥2=(∂rf~)2+r−2(∂θf~)2.
Une fonction C1 sur un cône est homogène de degré k si et seulement si elle vérifie la relation d'Euler⟨∇f(x),x⟩=kf(x); en économie, c'est le théorème de l'épuisement du produit pour des rendements d'échelle constants.
L'inégalité des accroissements finis∣f(b)−f(a)∣≤sup∥∇f∥⋅∥b−a∥ vaut sur un convexe et se démontre en restreignant au segment. L'égalité correspondante est fausse pour une fonction à valeurs vectorielles: le tour complet du cercle en est le contre-exemple.
Problème guidé 4.1 · Une sonde mobile sur la plaque chauffée
La plaque carrée [0,2]×[0,2] (en mètres) a pour température stationnaire modélisée T(x,y)=100−10x2−5y2 (en °C; modèle didactique). Une sonde se déplace en suivant r(t)=(1+2t,2−t), avec t en secondes. On étudie ce qui se passe à l'instant t=0, où la sonde se trouve au point a=(1,2).
1
Le gradient au point de départ
Commencez par calculer ∇T(x,y)=(−20x,−10y), puis évaluez-le en a=(1,2) et prenez sa norme: c'est le taux de variation maximal de la température par mètre parcouru.
Question
Calculez ∥∇T(1,2)∥, en °C/m.
La direction du mouvement
Le taux ressenti par unité de temps
Le meilleur cap possible
u=(53,54)
Soit f(x,y,z)=xyz. Calculer la dérivée de f en (1,2,3) dans la direction du vecteur v=(1,1,1).
Soit f(x,y)=exsiny. Déterminer, au point (0,4π), la direction de plus forte croissance et le taux correspondant.
Montrer que la fonction f(x,y)=∣xy∣ admet des dérivées partielles nulles en (0,0), mais qu'elle n'admet pas de dérivée directionnelle dans la direction u=(1,1)/2.
Solution
1.∇f=(2x+y,x+2y), donc ∇f(1,2)=(4,5). Le vecteur u est unitaire (9/25+16/25=1), d'où
Duf(1,2)=4⋅53+5⋅54=512+4=532=6,4.
2.∇f=(yz,xz,xy), donc ∇f(1,2,3)=(6,3,2). Le vecteur v=(1,1,1) : , et . Alors
Duf(1,2,3)=36+3+2=311=3113≈6,351.
Oublier la normalisation donnerait 11, une valeur 3 fois trop grande.
3.∇f=(exsiny,excosy), donc en (0,4π): , de norme . La direction de plus forte croissance est — c'est-à-dire la bissectrice, à — et le taux vaut . Toute autre direction donne fois moins.
4. Sur les axes, f(x,0)=0 et f(0,y)=0, donc les deux dérivées partielles en (0,0) sont nulles. En revanche, pour u=(1,1)/2,
qui vaut +1/2 à droite et −1/2 à gauche: la limite n'existe pas. Cette fonction est donc un exemple de plus du fait que les dérivées partielles ne disent presque rien: elles existent et sont nulles, alors qu'il n'y a même pas de dérivée directionnelle dans la direction diagonale.
(1,1,1)
Soit S la surface z=xy. Écrire l'équation du plan tangent en (2,3,6) de deux manières: en voyant S comme un graphe, puis comme une surface de niveau.
Montrer que toutes les droites normales à une sphère de centre c passent par c. Que devient l'énoncé pour un ellipsoïde?
Solution
1.f(2,1)=4−1=3: le point est sur la ligne de niveau x2−y2=3. Le gradient ∇f=(2x,−2y) vaut (4,−2) en (2,1), et il est non nul, donc la tangente est la droite passant par (2,1) et orthogonale à (4,−2):
4(x−2)−2(y−1)=0⟺4x−2y=6⟺2x−y=3.
Contrôle: la ligne de niveau se paramètre localement par y=x2−3, dont la dérivée en x=2 vaut x/x2−3=2; la tangente est bien la droite trouvée.
2. Avec F(x,y,z)=x2+2y2+3z2, on a F(1,1,1)=1+2+3=6: le point est sur la surface. , donc et le plan tangent est
2(x−1)+4(y−1)+6(z−1)=0⟺x+2y+3z=6.
La droite normale est x=(1,1,1)+s(2,4,6), soit (1+2s,1+4s,1+6s), s∈R. Elle ne passe pas par l'origine: il faudrait pour la première coordonnée, pour la deuxième.
3.Comme graphe.f(x,y)=xy, ∂x∂f=y=3 et ∂y∂f=x=2 au point, d'où , soit .
Comme surface de niveau.F(x,y,z)=xy−z, de niveau 0; ∇F=(y,x,−1)=(3,2,−1), d'où , soit . Les deux méthodes donnent la même équation, comme l'annonce le Callout de la section 2.
4. Pour la sphère F(x)=∥x−c∥2=R2, on a ∇F(x)=2(x−c). La normale en un point a de la sphère est donc ; pour on obtient . Toutes les normales passent donc par le centre.
Pour l'ellipsoïde a2x2+b2y2+c2z2=1, le gradient est , qui n'est colinéaire au vecteur position que si (sphère) ou si le point est sur l'un des axes. La propriété tombe donc: comme le montre le point 2, la normale en à ne passe pas par le centre.
dtdw
Soit f une fonction de classe C1 de deux variables, et posons z(u,v)=f(u+v,u−v). Montrer que ∂u∂z∂v∂z=(∂x∂f)2−(∂y∂f)2.
Soient F(u,v)=(u+v,uv) et G(x,y)=(x2−y,2xy). Calculer JG∘F(1,2) par le produit (4.11), puis vérifier par substitution.
Soient f de classe C1 sur R2 et g(t)=f(t,t2). Exprimer g′(t), puis calculer g′(1) sachant que ∇f(1,1)=(3,−2).
Solution
1.Règle de la chaîne.∇w=(2x,2y,2z) et r′(t)=(−sint,cost,1), donc
dtdw=2cost(−sint)+2sintcost+2t⋅1=2t.
Substitution.w(r(t))=cos2t+sin2t+t2=1+t2, de dérivée . Identique. Le résultat était prévisible: l'hélice monte à vitesse le long de et tourne sur un cylindre de rayon constant, donc seule la composante verticale fait varier .
2. Ici x(u,v)=u+v et y(u,v)=u−v, donc ∂u∂x=1, , , . La formule (4.10) donne
∂u∂z=∂x∂f+∂y∂f,∂v∂z=∂x∂f−∂y∂f,
où les dérivées de f sont évaluées en (u+v,u−v). Le produit vaut donc (∂x∂f)2−(∂y∂f)2 par identité remarquable. (Ce changement de variables est celui qui ramène l'équation des ondes à ; vous le reverrez.)
3.JF(u,v)=(1v1u), donc JF(1,2)=(1211). L'image est . Ensuite , donc et
JG∘F(1,2)=(64−16)(1211)=(416510).
Substitution.G(F(u,v))=((u+v)2−uv,2(u+v)uv)=(u2+uv+v2,2u2v+2uv2). Les dérivées partielles sont pour la première composante et pour la seconde, ce qui donne en : et . Les deux matrices coïncident. Les déterminants: , , et .
4. Avec r(t)=(t,t2) et r′(t)=(1,2t),
g′(t)=∂x∂f(t,t2)⋅1+∂y∂f(t,t2)⋅2t.
En t=1, le point image est (1,1), donc g′(1)=3×1+(−2)×2=3−4=−1. Notez qu'on n'a jamais eu besoin de connaître : c'est exactement ce que la règle de la chaîne permet.
∥∇f∥2=(∂rf~)2+r−2(∂θf~)2
Vérifier (4.16) sur f(x,y)=x2−y2 au point (1,1).
Soit f de classe C1 sur la couronne A={1<∥(x,y)∥<2} telle que ∂θf~≡0. Montrer que f ne dépend que de r, puis que ∇f est en tout point colinéaire au vecteur position.
Solution
1. Le repère (er,eθ) avec er=(cosθ,sinθ) et eθ=(−sinθ,cosθ) est orthonormé: ∥er∥=∥eθ∥=1 et ⟨er,eθ⟩=−cosθsinθ+sinθcosθ=0. Les formules (4.13) se lisent
∂rf~=⟨∇f,er⟩,r1∂θf~=⟨∇f,eθ⟩,
donc ces deux quantités sont les composantes de ∇f dans une base orthonormée. Le théorème de Pythagore (ou l'identité de Parseval en dimension finie) donne
2.f~(r,θ)=r2cos2θ−r2sin2θ=r2cos2θ. Donc et , d'où
(∂rf~)2+r21(∂θf~)2=4r2cos22θ+4r2sin22θ=4r2.
Au point (1,1), r2=2, donc la formule donne 8. Contrôle direct: ∇f=(2x,−2y)=(2,−2), de carré de norme 4+4=8. Identique. (On remarque au passage que ne dépend que de , alors que dépend aussi de .)
3. Fixons r∈]1,2[. La fonction θ↦f~(r,θ) est dérivable de dérivée nulle sur R, donc constante: f~(r,θ)=φ(r) pour une fonction , qui est de classe puisque . Ainsi : est radiale. La décomposition (4.15) donne alors
∇f=φ′(r)er+r1⋅0⋅eθ=φ′(r)er=rφ′(r)(x,y),
qui est bien colinéaire au vecteur position. Géométriquement: les lignes de niveau sont des cercles centrés à l'origine, et le gradient leur est orthogonal, donc radial. Notez que la conclusion utilise la connexité de chaque cercle, donc l'hypothèse que le domaine est une couronne et non, par exemple, un secteur privé d'un rayon.
k−1
En déduire, pour f de classe C2 et homogène de degré k, la relation i,j∑xixj∂xi∂xj∂2f=k(k−1)f.
Soit f différentiable sur R2 avec ∥∇f(x)∥≤3 pour tout x, et f(0,0)=5. Encadrer f(1,2).
Donner un exemple de fonction F:[0,1]→R2 de classe C1, non constante, telle que F(1)=F(0), et expliquer pourquoi cela n'invalide pas l'inégalité des accroissements finis.
Solution
1. Dérivons la relation f(tx)=tkf(x) par rapport à xj, à t>0 fixé. Le membre de gauche est la composée de x↦tx et de f; par la règle de la chaîne, sa dérivée partielle en xj vaut t∂xj∂f(tx). Le membre de droite donne tk∂xj∂f(x). Donc
∂xj∂f(tx)=tk−1∂xj∂f(x),
ce qui est exactement l'homogénéité de degré k−1. Exemple: f=x3+2xy2 (degré 3) a pour dérivée ∂xf=3x2+2y2, homogène de degré 2.
2. Appliquons la relation d'Euler (4.18) à la fonction gj=∂f/∂xj, homogène de degré k−1 par le point 1:
la dernière égalité étant à nouveau la relation d'Euler. Contrôle sur f=x3+2xy2, k=3, au point (1,2): les dérivées secondes sont ∂xx2f=6x=6, , ; la somme vaut , et . Identique.
3.R2 est convexe, donc le théorème 4.8 s'applique avec M=3 et ∥(1,2)−(0,0)∥=5:
∣f(1,2)−5∣≤35≈6,708,d’ouˋ−1,708≲f(1,2)≲11,708.
Précisément: 5−35≤f(1,2)≤5+35. L'encadrement est optimal, au sens où la fonction affine a un gradient de norme exactement et atteint la borne supérieure.
4. Prenons F(t)=(cos2πt,sin2πt): elle est de classe C∞, non constante, et F(1)=F(0)=(1,0). Sa dérivée F′(t)=2π(−sin2πt,cos2πt) a pour norme , constante et non nulle: il n'existe donc aucun tel que , ce qui réfute toute «égalité des accroissements finis» vectorielle.
L'inégalité, elle, reste vraie et n'est pas contredite: elle affirme ∥F(1)−F(0)∥≤sup∥F′∥⋅1, soit 0≤2π. C'est une majoration, donc une affirmation compatible avec un déplacement net nul; elle ne prétend jamais que le déplacement net soit atteint par une dérivée particulière. La différence conceptuelle est exactement celle qui sépare, à une variable, ∣f(b)−f(a)∣≤sup∣f′∣(b−a) de l'égalité de Lagrange: la première survit à la dimension, la seconde non.