
Dériver une fonction d’une seule variable revient à approcher sa courbe par une droite. Quand la fonction dépend de plusieurs variables, on remplace la droite par une application linéaire et le nombre dérivé par un vecteur, le gradient. Ce chapitre construit cet outil, puis s’en sert pour étudier les extrema, avec ou sans contrainte, et pour résoudre quelques équations aux dérivées partielles. Dans tout le chapitre, \(U\) est un ouvert de \(\mathbb{R}^n\) et \(f : U \to \mathbb{R}\).
1. Dérivées partielles
La dérivée partielle de \(f\) par rapport à la \(i\)-ème variable en \(a\in U\) est, si elle existe, la limite \[ \partial_i f(a)=\lim_{t\to 0}\dfrac{f(a+t e_i)-f(a)}{t}, \] où \((e_1,\dots,e_n)\) est la base canonique. C’est la dérivée en \(0\) de la fonction d’une variable \(t\mapsto f(a+te_i)\).
En pratique, on dérive par rapport à une variable en gelant les autres, comme si c’étaient des constantes. Géométriquement, \(\partial_x f(a,b)\) est la pente de la courbe obtenue en coupant la surface \(z=f(x,y)\) par le plan \(y=b\).
Pour \(f(x,y)=x^2y+\sin(xy)\), on obtient \(\partial_x f=2xy+y\cos(xy)\) et \(\partial_y f=x^2+x\cos(xy)\). En \((1,0)\) : \(\partial_x f(1,0)=0+0=0\) et \(\partial_y f(1,0)=1+1=2\).
Sur la figure, pour \(f(x,y)=x^2y\) et \(y=1\), la section est la parabole \(x\mapsto x^2\) : en \(x=1\), \(\partial_x f(1,1)=2xy=2\) est bien la pente de la tangente orange.
2. Différentielle et gradient
\(f\) est différentiable en \(a\) s’il existe une application linéaire \(L:\mathbb{R}^n\to\mathbb{R}\) telle que \[ f(a+h)=f(a)+L(h)+o(\|h\|)\quad (h\to 0). \] Cette application \(L=df_a\) est unique : c’est la différentielle de \(f\) en \(a\).
Si \(f\) est différentiable en \(a\), alors \(f\) est continue en \(a\), admet en \(a\) des dérivées partielles et même une dérivée selon tout vecteur \(v\), avec \[ df_a(h)=\sum_{i=1}^n \partial_i f(a)\,h_i=\langle \nabla f(a),h\rangle,\qquad D_vf(a)=df_a(v). \] Le vecteur \(\nabla f(a)=(\partial_1 f(a),\dots,\partial_n f(a))\) est le gradient de \(f\) en \(a\).
D’après l’inégalité de Cauchy-Schwarz, pour un vecteur unitaire \(v\), \(D_vf(a)\le\|\nabla f(a)\|\), avec égalité si \(v\) est dirigé par \(\nabla f(a)\) : le gradient indique la direction de plus forte croissance. De plus, si \(f\) est constante le long d’une courbe \(\gamma\) (ligne de niveau), alors \(\langle\nabla f(\gamma(t)),\gamma'(t)\rangle=0\) : le gradient est orthogonal aux lignes de niveau.

Soit \(f(x,y)=x^2+2y^2\) en \(a=(1,1)\). On a \(\nabla f(x,y)=(2x,4y)\), donc \(\nabla f(a)=(2,4)\) et \(df_a(h_1,h_2)=2h_1+4h_2\). Pour \(v=(1,0)\) : \(D_vf(a)=2\).
3. Fonctions de classe \(C^1\)
\(f\) est de classe \(C^1\) sur \(U\) si ses dérivées partielles existent en tout point de \(U\) et sont continues sur \(U\).
Si \(f\) est de classe \(C^1\) sur \(U\), alors \(f\) est différentiable en tout point de \(U\). C’est le critère pratique pour montrer qu’une fonction est différentiable : les sommes, produits, composées de fonctions \(C^1\) le sont encore.
L’existence des dérivées partielles seule ne suffit pas. Pour \(f(x,y)=\dfrac{xy}{x^2+y^2}\) et \(f(0,0)=0\), on a \(\partial_xf(0,0)=\partial_yf(0,0)=0\) (car \(f\) s’annule sur les axes), mais \(f(t,t)=\tfrac12\) pour \(t\neq 0\) : \(f\) n’est même pas continue en \((0,0)\), donc pas différentiable.
4. Règle de la chaîne
Soit \(f\) de classe \(C^1\) sur \(U\subset\mathbb{R}^n\) et \(\varphi=(\varphi_1,\dots,\varphi_n)\) de classe \(C^1\) d’un ouvert de \(\mathbb{R}^p\) dans \(U\). Alors \(g=f\circ\varphi\) est \(C^1\) et \[ \partial_j g(u)=\sum_{i=1}^n \partial_i f(\varphi(u))\,\partial_j\varphi_i(u). \] Pour une courbe \(\gamma\) d’une variable : \((f\circ\gamma)'(t)=\langle\nabla f(\gamma(t)),\gamma'(t)\rangle\).
Pour \(f(x,y)=x^2y\) et \(\gamma(t)=(t,t^2)\) : \((f\circ\gamma)'(t)=2xy\cdot 1+x^2\cdot 2t=2t^3+2t^3=4t^3\). On retrouve bien \(f(\gamma(t))=t^4\), de dérivée \(4t^3\).
Posons \(g(r,\theta)=f(r\cos\theta,r\sin\theta)\). Alors \(\partial_r g=\cos\theta\,\partial_xf+\sin\theta\,\partial_yf\) et \(\partial_\theta g=-r\sin\theta\,\partial_xf+r\cos\theta\,\partial_yf\).
5. Dérivées d’ordre 2 et Hessienne
Si \(f\) est de classe \(C^2\) sur \(U\), alors \(\partial_i\partial_j f=\partial_j\partial_i f\). La matrice hessienne \(H_f(a)=\big(\partial_i\partial_jf(a)\big)_{i,j}\) est alors symétrique réelle, donc diagonalisable en base orthonormée.
Si \(f\) est \(C^2\), \[ f(a+h)=f(a)+\langle\nabla f(a),h\rangle+\tfrac12\,h^{T}H_f(a)\,h+o(\|h\|^2). \]
Pour \(f(x,y)=x^2e^y\) : \(\partial_xf=2xe^y\), \(\partial_yf=x^2e^y\), puis \(\partial_x^2f=2e^y\), \(\partial_x\partial_yf=\partial_y\partial_xf=2xe^y\), \(\partial_y^2f=x^2e^y\). En \((1,0)\) : \(H_f(1,0)=\begin{pmatrix}2&2\\2&1\end{pmatrix}\).
6. Extrema locaux
Si \(f\) est différentiable sur l’ouvert \(U\) et admet un extremum local en \(a\), alors \(\nabla f(a)=0\) : \(a\) est un point critique. La réciproque est fausse.
Soit \(f\) de classe \(C^2\) et \(a\) un point critique. Si \(H_f(a)\) a toutes ses valeurs propres strictement positives, \(a\) est un minimum local strict ; si elles sont toutes strictement négatives, un maximum local strict ; si elles sont de signes opposés, \(a\) n’est pas un extremum (point selle). Si \(0\) est valeur propre, on ne conclut pas avec la Hessienne seule.
En dimension 2, avec \(r=\partial_x^2f,\ s=\partial_x\partial_yf,\ t=\partial_y^2f\) : si \(rt-s^2>0\), extremum (minimum si \(r>0\), maximum si \(r<0\)) ; si \(rt-s^2<0\), point selle.

Étudions \(f(x,y)=x^3-12x+y^2-2y\). Alors \(\nabla f=(3x^2-12,\,2y-2)\) s’annule en \((2,1)\) et \((-2,1)\). La Hessienne est \(\begin{pmatrix}6x&0\\0&2\end{pmatrix}\). En \((2,1)\) : valeurs propres \(12\) et \(2\), donc minimum local, valeur \(-17\). En \((-2,1)\) : valeurs propres \(-12\) et \(2\), donc point selle.
Pour \(f(x,y)=x^4+y^2\) l’origine est un point critique et \(H_f(0,0)=\mathrm{diag}(0,2)\) est dégénérée, mais \(f(x,y)\ge 0=f(0,0)\) : c’est un minimum. Pour \(x^4\) remplacé par \(-x^4\), ce serait un point selle. Il faut alors étudier \(f\) directement.
7. Optimisation sous contrainte
Soit \(f,g\) de classe \(C^1\) sur \(U\) et \(\Gamma=\{g=0\}\). Si la restriction de \(f\) à \(\Gamma\) admet un extremum local en \(a\) et si \(\nabla g(a)\neq0\), il existe un réel \(\lambda\) tel que \[ \nabla f(a)=\lambda\,\nabla g(a). \] Les gradients sont colinéaires : au point optimal, la ligne de niveau de \(f\) est tangente à la contrainte.
- Écrire la contrainte \(g=0\) et vérifier que \(\nabla g\) ne s’annule pas sur \(\Gamma\).
- Résoudre le système \(\nabla f=\lambda\nabla g\), \(g=0\).
- Comparer les valeurs de \(f\) aux points trouvés ; si \(\Gamma\) est compacte, \(f\) y atteint son maximum et son minimum parmi ces points.
Extrema de \(f(x,y)=x+2y\) sur le cercle \(x^2+y^2=5\). Ici \(\nabla f=(1,2)\) et \(\nabla g=(2x,2y)\). Le système \(1=2\lambda x,\ 2=2\lambda y\) donne \(y=2x\), puis \(5x^2=5\), soit \(x=\pm1\). Points \(A(1,2)\) avec \(f=5\) et \(B(-1,-2)\) avec \(f=-5\). Le cercle est compact : \(5\) est le maximum et \(-5\) le minimum.

8. Équations aux dérivées partielles
Une EDP relie une fonction de plusieurs variables à ses dérivées partielles. La règle de la chaîne permet de la simplifier par un changement de variables.
Cherchons les fonctions \(C^1\) sur \(\mathbb{R}^2\) telles que \(\partial_tu+c\,\partial_xu=0\). Posons \(u(x,t)=v(x-ct,\,t)\). La règle de la chaîne donne \(\partial_tu=-c\,\partial_1v+\partial_2v\) et \(\partial_xu=\partial_1v\), donc l’équation devient \(\partial_2v=0\) : \(v\) ne dépend que de sa première variable. Les solutions sont \(u(x,t)=\varphi(x-ct)\), avec \(\varphi\) de classe \(C^1\) : une onde qui se déplace à la vitesse \(c\).
Pour vérifier qu’une fonction résout une EDP, ne cherche pas à la deviner : dérive-la avec la règle de la chaîne et remplace. Si tout s’annule, c’est gagné.
\(u(x,y)=x^2-y^2\) vérifie \(\partial_x^2u+\partial_y^2u=2-2=0\) : elle est harmonique. C’est aussi le cas de \(xy\).
À retenir
- Une dérivée partielle se calcule en gelant les autres variables ; elle ne suffit pas à assurer la différentiabilité.
- \(C^1\Rightarrow\) différentiable \(\Rightarrow\) continue et \(df_a(h)=\langle\nabla f(a),h\rangle\) ; le gradient est orthogonal aux lignes de niveau.
- Chaîne : \((f\circ\gamma)'(t)=\langle\nabla f(\gamma(t)),\gamma'(t)\rangle\).
- Schwarz : en classe \(C^2\), la Hessienne est symétrique ; Taylor-Young à l’ordre 2 avec \(\tfrac12h^THh\).
- Extremum local sur un ouvert \(\Rightarrow\) \(\nabla f=0\) ; la Hessienne classe minimum, maximum, selle (cas dégénéré à étudier à part).
- Sous contrainte \(g=0\) : \(\nabla f=\lambda\nabla g\) ; en EDP, on change de variables par la règle de la chaîne.
Entraîne-toi : défi express de Maths Spé
🚀 Zyro te conseille la suite
✏️ Exercices de mathsCalcul différentiel : exercices de maths Maths Spé
📝 Contrôles de mathsCalcul différentiel : contrôle de maths Maths Spé
🎯 QCM de mathsCalcul différentiel : QCM de maths Maths Spé
✏️ Exercices de mathsÉquations différentielles linéaires : exercices de maths Maths Spé
✏️ Exercices de mathsProbabilités et variables aléatoires discrètes : exercices de maths Maths Spé
📝 Contrôles de mathsÉquations différentielles linéaires : contrôle de maths Maths Spé

