Hessienne et extrema libres en L2 de maths : cours et méthodes

Hessienne et extrema libres – Cours de maths en Licence 2 sur Maths-pdf.fr Couverture : Manuel de cours de maths L2 en PDF Télécharger en PDF Le livre des cours de maths en L2 PDF à imprimer Voir le livre ›


Ce cours sur les extrema libres L2 prolonge directement le chapitre sur la différentielle et la jacobienne. Après l’ordre 1, nous passons aux dérivées partielles d’ordre 2, au théorème de Schwarz et à la matrice hessienne. Ces outils donnent une formule de Taylor-Young qui décrit une fonction de plusieurs variables au voisinage d’un point.

L’objectif est pratique : trouver les points critiques, décider s’il s’agit d’un minimum, d’un maximum ou d’un point col, puis chercher un extremum global sur un compact. Les conditions d’ordre 2 sont démontrées et commentées, et plusieurs exemples montrent ce qui se passe quand la hessienne ne permet pas de conclure.

Ce chapitre prépare les formes quadratiques, l’optimisation sous contrainte et les méthodes numériques d’optimisation.

Ce que vous saurez faire

  • Calculer les dérivées partielles d’ordre 2 et vérifier l’égalité de Schwarz.
  • Écrire la matrice hessienne et le développement de Taylor-Young à l’ordre 2.
  • Trouver tous les points critiques d’une fonction de deux ou trois variables.
  • Conclure sur la nature d’un point critique grâce à la hessienne.
  • Reconnaître un point col et traiter à la main les cas où la hessienne ne suffit pas.
  • Trouver la plus petite et la plus grande valeur d’une fonction sur un compact, frontière comprise.

1. Dérivées partielles d’ordre 2 et théorème de Schwarz

Dans tout le chapitre, \(U\) désigne un ouvert de \(\mathbb{R}^n\), le plus souvent de \(\mathbb{R}^2\), et \(f\) une fonction de \(U\) dans \(\mathbb{R}\). Nous supposons connues la différentielle et les dérivées partielles d’ordre 1. L’idée est maintenant de dériver une seconde fois.

1.1 Dérivées secondes

Définition :

Supposons que \(\frac{\partial f}{\partial x_j}\) existe sur \(U\). Si cette fonction admet à son tour une dérivée partielle par rapport à \(x_i\), on la note \[\frac{\partial^2 f}{\partial x_i \partial x_j} = \frac{\partial}{\partial x_i}\left(\frac{\partial f}{\partial x_j}\right).\] Lorsque toutes ces dérivées existent et sont continues sur \(U\), on dit que \(f\) est de classe \(C^2\) sur \(U\).

Une fonction de deux variables possède ainsi quatre dérivées secondes. Les deux dérivées « croisées » diffèrent par l’ordre des dérivations. Par ailleurs, les sommes, produits, quotients et composées de fonctions \(C^2\) restent \(C^2\) là où elles sont définies. C’est pourquoi la régularité se justifie en général en une phrase.

Exemple guidé :

Prenons \(f(x, y) = y\sin(x^2) + xe^{2y}\), de classe \(C^2\) sur \(\mathbb{R}^2\) comme composée de fonctions usuelles. D’abord, \(\frac{\partial f}{\partial x} = 2xy\cos(x^2) + e^{2y}\) et \(\frac{\partial f}{\partial y} = \sin(x^2) + 2xe^{2y}\). Ensuite, en dérivant la première par rapport à \(y\), on obtient \(2x\cos(x^2) + 2e^{2y}\). De même, en dérivant la seconde par rapport à \(x\), on trouve \(2x\cos(x^2) + 2e^{2y}\). Les deux dérivées croisées coïncident.

1.2 Le théorème de Schwarz

La coïncidence observée n’a rien d’un hasard. Elle découle d’un théorème que nous démontrons, car sa preuve éclaire le rôle exact de la continuité.

Théorème :

Soit \(f\) de classe \(C^2\) sur l’ouvert \(U\). En chaque point de \(U\) et pour tout couple d’indices \((i, j)\), on a \[\frac{\partial^2 f}{\partial x_i \partial x_j} = \frac{\partial^2 f}{\partial x_j \partial x_i}.\]

Preuve :

Il suffit de traiter deux variables, au point \((a, b)\). Pour \(h\) et \(k\) petits et non nuls, posons \(\Delta = f(a + h, b + k) – f(a + h, b) – f(a, b + k) + f(a, b)\). D’une part, \(\Delta = \varphi(a + h) – \varphi(a)\) avec \(\varphi(x) = f(x, b + k) – f(x, b)\). Le théorème des accroissements finis, appliqué deux fois, fournit un point \((\xi, \eta)\) du rectangle de sommets \((a, b)\) et \((a + h, b + k)\) tel que \(\Delta = hk\,\frac{\partial^2 f}{\partial y \partial x}(\xi, \eta)\). Symétriquement, \(\Delta\) est aussi l’accroissement de \(\psi(y) = f(a + h, y) – f(a, y)\) entre \(b\) et \(b + k\), ce qui fournit \(\Delta = hk\,\frac{\partial^2 f}{\partial x \partial y}(\xi^{\prime}, \eta^{\prime})\). En divisant par \(hk\) et en faisant tendre \((h, k)\) vers \((0, 0)\), la continuité des dérivées croisées donne l’égalité.

1.3 Sans continuité, Schwarz peut tomber en défaut

La preuve utilise la continuité au tout dernier moment. Sans elle, on ne peut pas passer à la limite, et le résultat peut effectivement tomber en défaut.

Contre-exemple :

Soit \(f(x, y) = \frac{xy^3}{x^2 + y^2}\) si \((x, y) \neq (0, 0)\) et \(f(0, 0) = 0\). Pour \(y \neq 0\), le taux \(\frac{f(h, y) – f(0, y)}{h} = \frac{y^3}{h^2 + y^2}\) tend vers \(y\) ; pour \(y = 0\), il est nul. Ainsi \(\frac{\partial f}{\partial x}(0, y) = y\) pour tout \(y\), d’où \(\frac{\partial^2 f}{\partial y \partial x}(0, 0) = 1\). En revanche, \(\frac{f(x, k) – f(x, 0)}{k} = \frac{xk^2}{x^2 + k^2}\) tend vers 0. La dérivée partielle en \(y\) est donc nulle en chaque point de l’axe des abscisses, et \(\frac{\partial^2 f}{\partial x \partial y}(0, 0) = 0\). Les dérivées croisées diffèrent : \(f\) n’est donc pas \(C^2\) au voisinage de l’origine.

Remarque :

Le théorème de Schwarz sert aussi de test. Si l’on trouve deux dérivées croisées différentes pour une fonction manifestement \(C^2\), c’est qu’un calcul est faux. Vérifier Schwarz est donc un excellent réflexe de contrôle.

2. Matrice hessienne et formule de Taylor-Young

Les dérivées secondes se rangent naturellement dans une matrice carrée. Cette matrice joue, pour les fonctions de plusieurs variables, le rôle de la dérivée seconde d’une fonction d’une variable.

2.1 La matrice hessienne

Définition :

Si \(f\) est de classe \(C^2\) sur \(U\) et \(a \in U\), la matrice hessienne de \(f\) en \(a\) est la matrice \(H_f(a)\) de taille \(n\), dont le coefficient en ligne \(i\) et colonne \(j\) vaut \(\frac{\partial^2 f}{\partial x_i \partial x_j}(a)\). D’après le théorème de Schwarz, cette matrice est symétrique.

Notation :

Pour deux variables, on utilise souvent les lettres de Monge \(r\), \(s\) et \(t\) : ce sont, dans l’ordre, la dérivée seconde deux fois en \(x\), la dérivée croisée et la dérivée seconde deux fois en \(y\), prises au point \(a\). La hessienne s’écrit alors \(\begin{pmatrix} r & s \\ s & t \end{pmatrix}\), et son déterminant vaut \(rt – s^2\).

À la hessienne on associe la forme quadratique \(q_a(h) = h^{\top}H_f(a)h\). En deux variables, avec \(h = (u, v)\), cela donne \(q_a(u, v) = ru^2 + 2suv + tv^2\). C’est cette forme quadratique qui va décider de la nature des points critiques.

2.2 Taylor-Young à l’ordre 2

Théorème :

Soit \(f\) de classe \(C^2\) sur \(U\) et \(a \in U\). Quand \(h\) tend vers 0, \[f(a + h) = f(a) + \nabla f(a) \cdot h + \frac{1}{2}\,h^{\top}H_f(a)h + o\left(\|h\|^2\right).\]

Preuve :

Fixons \(r_0 > 0\) tel que la boule fermée de centre \(a\) et de rayon \(r_0\) soit incluse dans \(U\). Pour \(\|h\| \leqslant r_0\), posons \(\varphi(\tau) = f(a + \tau h)\) pour \(\tau \in [0, 1]\). La règle de la chaîne donne \(\varphi^{\prime}(\tau) = \nabla f(a + \tau h) \cdot h\), puis \(\varphi^{\prime\prime}(\tau) = h^{\top}H_f(a + \tau h)h\). Ensuite, on applique à \(\varphi\) le développement de Taylor au premier ordre, avec un reste sous forme d’intégrale : \(\varphi(1) = \varphi(0) + \varphi^{\prime}(0) + \int_0^1 (1 – \tau)\varphi^{\prime\prime}(\tau)\,\mathrm{d}\tau\). Or \(\int_0^1 (1 – \tau)\,\mathrm{d}\tau = \frac{1}{2}\). L’écart entre le reste et \(\frac{1}{2}h^{\top}H_f(a)h\) est donc majoré par \(\frac{1}{2}\|h\|^2\) fois le maximum, sur le segment \([a, a + h]\), de la norme de \(H_f(a + \tau h) – H_f(a)\). Enfin, ce maximum tend vers 0 avec \(h\), par continuité des dérivées secondes.

2.3 Un premier développement

Autrement dit, près de \(a\), la fonction ressemble à un polynôme de degré 2. Le plan tangent donne l’approximation d’ordre 1 ; la hessienne indique comment la surface s’en écarte.

Exemple guidé :

Développons \(f(x, y) = \ln(1 + x + 2y)\) en \((0, 0)\). La fonction est \(C^2\) sur l’ouvert où \(1 + x + 2y > 0\). D’abord, \(\nabla f(x, y) = \frac{1}{1 + x + 2y}(1, 2)\), donc \(\nabla f(0, 0) = (1, 2)\). Ensuite, les dérivées secondes valent \(-\frac{1}{(1 + x + 2y)^2}\) fois \(1\), \(2\) et \(4\). Ainsi \(H_f(0, 0) = \begin{pmatrix} -1 & -2 \\ -2 & -4 \end{pmatrix}\), et \[f(x, y) = x + 2y – \frac{1}{2}(x + 2y)^2 + o\left(x^2 + y^2\right).\] On retrouve le développement \(\ln(1 + w) = w – \frac{w^2}{2} + o(w^2)\) avec \(w = x + 2y\), ce qui confirme le calcul.

2.4 Lecture géométrique

Considérons la surface d’équation \(z = f(x, y)\) et son plan tangent au point d’abscisses \(a\). D’après Taylor-Young, l’écart vertical entre la surface et ce plan vaut \(\frac{1}{2}q_a(h) + o(\|h\|^2)\). Ainsi, la hessienne mesure la façon dont la surface se courbe au-dessus ou au-dessous du plan.

Trois situations se présentent alors. Si \(q_a\) est positive dans toutes les directions, la surface reste localement au-dessus de son plan tangent, comme un bol. Si elle est négative partout, la surface reste au-dessous, comme un dôme. Enfin, si elle change de signe, la surface traverse son plan tangent : elle monte dans certaines directions et descend dans d’autres.

Cette lecture prépare directement la partie 4. En effet, en un point critique, le plan tangent est horizontal. Comparer la surface à ce plan revient donc à comparer \(f(a + h)\) à \(f(a)\), c’est-à-dire à chercher un extremum.

Pour l’exemple du logarithme, la figure compare la fonction et son approximation d’ordre 2 le long de la droite \(y = x\). Les deux courbes se confondent près de l’origine, puis s’écartent.

Coupe de la fonction logarithme de un plus x plus deux y et de son approximation de Taylor-Young d'ordre deux

3. Points critiques et condition nécessaire d’extremum

3.1 Extrema locaux et globaux

Définition :

Le point \(a \in U\) est un minimum local de \(f\) lorsque \(f(x) \geqslant f(a)\) pour tous les \(x\) de \(U\) assez proches de \(a\), c’est-à-dire situés dans une certaine boule de centre \(a\). Le minimum est strict si l’inégalité est stricte pour \(x \neq a\). Si l’inégalité vaut sur tout le domaine, le minimum est global. Les maxima se définissent de même, et le mot extremum désigne l’un ou l’autre.

On parle d’extrema « libres » parce que la variable parcourt un ouvert, sans contrainte. Les extrema sous contrainte, par exemple sur une courbe, relèvent d’une autre méthode, vue plus tard.

3.2 La condition du premier ordre

Définition :

Un point \(a\) de \(U\) est un point critique de \(f\), supposée différentiable, si \(\nabla f(a) = 0\), c’est-à-dire si toutes les dérivées partielles d’ordre 1 s’annulent en \(a\).

Théorème :

Soit \(f\) différentiable sur l’ouvert \(U\). En tout point de \(U\) où \(f\) présente un extremum local, le gradient de \(f\) est nul.

Preuve :

Supposons par exemple un minimum local. Fixons un indice \(i\) et considérons \(g(\tau) = f(a + \tau e_i)\), définie pour \(\tau\) proche de 0 parce que \(U\) est ouvert. Cette fonction d’une variable admet un minimum local en 0, point intérieur de son intervalle de définition. Par conséquent, \(g^{\prime}(0) = 0\). Or \(g^{\prime}(0) = \frac{\partial f}{\partial x_i}(a)\), ce qui conclut.

Piège à éviter :

La réciproque est fausse. Par exemple, \(f(x, y) = x^2 – y^2\) a un gradient nul à l’origine, mais \(f(\tau, 0) > 0 > f(0, \tau)\) pour \(\tau \neq 0\). Aucun extremum ne se trouve donc en l’origine. Par ailleurs, l’hypothèse « \(U\) ouvert » est indispensable : sur un domaine fermé, un extremum situé au bord n’annule pas forcément le gradient.

3.3 Méthode de recherche des points critiques

Comment faire :
  1. Justifier que \(f\) est \(C^2\) sur un ouvert et calculer ses dérivées partielles d’ordre 1.
  2. Écrire le système \(\nabla f = 0\) et le résoudre en distinguant tous les cas, notamment lors d’une factorisation.
  3. Vérifier chaque solution en la réinjectant dans le système.
  4. Étudier ensuite la nature de chaque point critique, point par point.
Exemple guidé :

Cherchons les points critiques de \(f(x, y) = 2x^3 – 6xy + 3y^2\) sur \(\mathbb{R}^2\). Les dérivées partielles sont \(6x^2 – 6y\) et \(-6x + 6y\). La seconde équation impose \(y = x\). Ensuite, la première devient \(x^2 = x\), donc \(x = 0\) ou \(x = 1\). Les points critiques sont ainsi \((0, 0)\) et \((1, 1)\). Nous déterminerons leur nature dans la partie suivante.

3.4 Résoudre le système sans perdre de solution

La recherche des points critiques mène à un système non linéaire. Il n’existe donc pas de méthode universelle, mais quelques réflexes évitent la plupart des oublis. D’abord, on factorise chaque équation autant que possible. Ensuite, on traite les cas un par un, en écrivant explicitement « premier cas », « second cas ».

Prenons \(g(x, y) = x^2y – y – x^2\). Ses dérivées partielles sont \(2x(y – 1)\) et \(x^2 – 1\). La seconde équation donne \(x = 1\) ou \(x = -1\). Dans les deux cas, \(x \neq 0\), donc la première impose \(y = 1\). Les points critiques sont \((1, 1)\) et \((-1, 1)\).

Supposons maintenant qu’on ait commencé par la première équation. On aurait alors deux cas : \(x = 0\) ou \(y = 1\). Le cas \(x = 0\) est incompatible avec la seconde équation, puisque \(0 – 1 \neq 0\). Le cas \(y = 1\) redonne les deux points. On obtient donc le même résultat, mais seulement parce que chaque cas a été examiné.

En revanche, simplifier \(2x(y – 1) = 0\) par \(x\) sans précaution reviendrait à supposer \(x \neq 0\). Dans d’autres exemples, ce geste fait disparaître un point critique. C’est pourquoi on ne divise jamais par une expression qui peut s’annuler sans traiter à part le cas où elle est nulle.

4. Conditions d’ordre 2 : lire la hessienne

Lorsque le gradient s’annule, le terme d’ordre 1 de Taylor-Young disparaît. Il reste \(f(a + h) – f(a) = \frac{1}{2}q_a(h) + o(\|h\|^2)\). Le signe de la forme quadratique \(q_a\) va donc, le plus souvent, décider du signe de \(f(a + h) – f(a)\).

4.1 Le critère en deux variables

Théorème :

Soit \(f\) de classe \(C^2\) sur un ouvert de \(\mathbb{R}^2\) et \(a\) un point critique, de hessienne \(\begin{pmatrix} r & s \\ s & t \end{pmatrix}\).

  • Si \(rt – s^2 > 0\) et \(r > 0\), alors \(f\) admet en \(a\) un minimum local strict.
  • Si \(rt – s^2 > 0\) et \(r < 0\), alors \(f\) admet en \(a\) un maximum local strict.
  • Si \(rt – s^2 < 0\), alors \(a\) est un point col, où \(f\) ne présente aucun extremum.
  • Si \(rt – s^2 = 0\), on ne peut pas conclure avec l’ordre 2.
Preuve :

Supposons \(rt – s^2 > 0\) et \(r > 0\). La mise sous forme canonique donne \(q_a(u, v) = r\left(u + \frac{s}{r}v\right)^2 + \frac{rt – s^2}{r}v^2\). Cette forme est donc strictement positive hors de l’origine. Comme elle est continue, elle atteint sur le cercle unité, qui est compact, un minimum \(m > 0\). Par homogénéité, \(q_a(h) \geqslant m\|h\|^2\) pour tout \(h\). Ensuite, Taylor-Young fournit \(\delta > 0\) tel que le reste soit, en valeur absolue, au plus \(\frac{m}{3}\|h\|^2\) dès que \(\|h\| < \delta\). Pour \(0 < \|h\| < \delta\), l’écart \(f(a + h) – f(a)\) est donc minoré par \(\left(\frac{m}{2} – \frac{m}{3}\right)\|h\|^2\), qui est strictement positif. Le cas \(r < 0\) s’en déduit en remplaçant \(f\) par \(-f\). Enfin, si \(rt – s^2 < 0\), le trinôme \(q_a\) prend des valeurs strictement positives dans une direction \(h_1\) et strictement négatives dans une direction \(h_2\). Le long de la droite dirigée par \(h_1\), on a \(f(a + \tau h_1) – f(a) = \frac{\tau^2}{2}q_a(h_1) + o(\tau^2)\), qui est strictement positif pour \(\tau\) petit non nul. De même, \(f\) prend des valeurs strictement plus petites que \(f(a)\) le long de \(h_2\).

4.2 Retour sur l’exemple de la partie 3

Exemple guidé :

Reprenons \(f(x, y) = 2x^3 – 6xy + 3y^2\). Ses dérivées secondes sont \(r = 12x\), \(s = -6\) et \(t = 6\). En \((0, 0)\), on trouve \(rt – s^2 = -36 < 0\) : c’est un point col. En \((1, 1)\), on trouve \(rt – s^2 = 72 – 36 = 36 > 0\) avec \(r = 12 > 0\) : c’est un minimum local strict, de valeur \(f(1, 1) = -1\). Ce minimum n’est pourtant pas global, puisque \(f(x, 0) = 2x^3\) tend vers \(-\infty\) quand \(x\) tend vers \(-\infty\).

Comment faire :
  1. Calculer les trois dérivées secondes en un point quelconque, une fois pour toutes.
  2. Évaluer \(r\), \(s\) et \(t\) en chaque point critique, puis le signe de \(rt – s^2\).
  3. Si \(rt – s^2 > 0\), lire le signe de \(r\) ; si \(rt – s^2 < 0\), conclure à un col.
  4. Si \(rt – s^2 = 0\), abandonner le critère et étudier la fonction à la main.
  5. Pour un extremum global, chercher un argument supplémentaire.

Les lignes de niveau rendent ces deux comportements visibles. Autour du minimum, elles forment des courbes fermées emboîtées. Au col, en revanche, deux lignes de niveau se croisent en formant une croix.

Lignes de niveau de la fonction deux x cube moins six xy plus trois y carré avec le col et le minimum local

4.3 Points cols

Un point col, ou point selle, est un point critique au voisinage duquel la fonction prend des valeurs plus grandes et plus petites que \(f(a)\). Le nom vient du relief : sur un col de montagne, la route monte dans une direction et descend dans l’autre. Ainsi, la surface \(z = f(x, y)\) ressemble localement à une selle de cheval.

Surface en forme de selle de cheval au voisinage d'un point col avec deux directions de pente opposée
À savoir :

Pour prouver qu’un point critique \(a\) n’est pas un extremum, il suffit d’exhiber deux chemins issus de \(a\) : l’un le long duquel \(f\) est strictement plus grande que \(f(a)\), l’autre le long duquel elle est strictement plus petite. Ces chemins peuvent être des droites ou des courbes.

4.4 Quand la hessienne ne suffit pas

Si \(rt – s^2 = 0\), le terme d’ordre 2 s’annule dans au moins une direction. Ce sont alors les termes d’ordre supérieur qui décident, et l’ordre 2 ne permet pas de conclure. Deux fonctions de même hessienne le montrent bien.

Contre-exemple :

Posons \(f_1(x, y) = (x – y)^2 + y^4\) et \(f_2(x, y) = (x – y)^2 – y^4\). L’origine est un point critique de chacune, avec la même hessienne \(\begin{pmatrix} 2 & -2 \\ -2 & 2 \end{pmatrix}\), de déterminant nul. Pourtant, \(f_1\) est positive et ne s’annule qu’en \((0, 0)\) : c’est un minimum strict. Au contraire, \(f_2(\tau, \tau) = -\tau^4 < 0\) et \(f_2(\tau, 0) = \tau^2 > 0\) : l’origine est un col pour \(f_2\).

La figure montre ces deux fonctions le long de la droite \(y = x\), seule direction où le terme quadratique s’annule. C’est précisément là que tout se joue.

Restrictions des deux fonctions à la droite y égale x, l'une positive et l'autre négative

Piège à éviter :

Conclure « pas d’extremum » dès que \(rt – s^2 = 0\) est une erreur classique. Dans ce cas, on étudie la fonction à la main : somme de carrés, restrictions à des droites, ou mieux à des courbes. En effet, une fonction peut avoir un minimum le long de toutes les droites sans avoir de minimum local.

4.5 Le cas de n variables

En dimension quelconque, le critère s’énonce avec le signe de la forme quadratique \(q_a\). Si \(q_a(h) > 0\) pour tout \(h \neq 0\), alors \(a\) est un minimum local strict ; la preuve est identique, avec la sphère unité. Si \(q_a\) prend des valeurs des deux signes, alors \(a\) est un col.

Proposition :

Si \(f\) est \(C^2\) et admet un minimum local en \(a\), alors \(q_a(h) \geqslant 0\) pour tout \(h\). Autrement dit, la hessienne d’un minimum local est positive.

Preuve :

On sait déjà que \(\nabla f(a) = 0\). Pour \(h\) fixé et \(\tau\) proche de 0, Taylor-Young donne \(0 \leqslant f(a + \tau h) – f(a) = \frac{\tau^2}{2}q_a(h) + o(\tau^2)\). En divisant par \(\tau^2\) puis en faisant tendre \(\tau\) vers 0, on obtient \(q_a(h) \geqslant 0\).

Remarque :

Pour étudier le signe de \(q_a\) en trois variables, on écrit souvent la forme comme une somme de carrés, par la méthode de Gauss. Plus tard, le théorème spectral permettra de lire ce signe sur les valeurs propres de la hessienne.

5. Extremum global sur un compact

Les résultats précédents sont locaux. Pour un extremum global, il faut un argument d’une autre nature. Le plus utile est la compacité, étudiée dans le chapitre sur les normes.

5.1 Existence par compacité

Théorème :

Toute fonction continue sur une partie compacte non vide \(K\) de \(\mathbb{R}^n\) y possède une plus petite et une plus grande valeur. Autrement dit, on trouve deux points \(a\) et \(b\) de \(K\) vérifiant \(f(a) \leqslant f \leqslant f(b)\) sur \(K\) tout entier.

Rappelons qu’en dimension finie, les compacts sont les parties fermées et bornées. Par exemple, un disque fermé, un carré fermé ou un triangle plein sont compacts. En revanche, un ouvert non vide ne l’est jamais.

Supposons maintenant que \(f\) soit \(C^1\) sur un ouvert contenant \(K\). Si l’extremum est atteint en un point intérieur à \(K\), c’est un point critique, d’après la partie 3. Sinon, il est atteint sur le bord. D’où une méthode en trois temps.

Comment faire :
  1. Justifier l’existence des extrema globaux : \(f\) continue sur \(K\) compact.
  2. Chercher les points critiques situés à l’intérieur de \(K\) et calculer \(f\) en chacun ; leur nature est inutile.
  3. Paramétrer chaque morceau du bord et étudier la fonction d’une variable obtenue, extrémités comprises.
  4. Comparer toutes les valeurs : la plus grande est le maximum, la plus petite le minimum.

5.2 Un exemple complet

Exemple guidé :

Soit \(T\) le triangle plein défini par \(x \geqslant 0\), \(y \geqslant 0\) et \(x + y \leqslant 3\), et \(f(x, y) = x^2 + y^2 – xy – x – y\). D’abord, \(T\) est fermé et borné, donc compact, et \(f\) est continue : les extrema existent. Ensuite, le gradient \((2x – y – 1, 2y – x – 1)\) s’annule seulement en \((1, 1)\), intérieur à \(T\), où \(f(1, 1) = -1\).

Étudions enfin le bord. Sur le côté \(y = 0\), on a \(f(x, 0) = x^2 – x\) pour \(x \in [0, 3]\), qui varie entre \(-\frac{1}{4}\) et \(6\). Par symétrie, le côté \(x = 0\) donne les mêmes valeurs. Sur l’hypoténuse, \(f(x, 3 – x) = 3x^2 – 9x + 6 = 3(x – 1)(x – 2)\), qui varie entre \(-\frac{3}{4}\) et \(6\). En comparant, le minimum global vaut \(-1\), atteint en \((1, 1)\), et le maximum global vaut \(6\), atteint en \((3, 0)\) et \((0, 3)\).

La figure montre les lignes de niveau de \(f\) sur le triangle. Le minimum se trouve au centre des ellipses, et le maximum aux deux sommets situés sur les axes.

Lignes de niveau sur le triangle plein avec le minimum intérieur et les deux sommets où le maximum est atteint

Piège à éviter :

Les points critiques intérieurs ne suffisent pas : ici, le maximum est atteint au bord, en des points où le gradient ne s’annule pas. Inversement, sur un domaine non compact, rien ne garantit l’existence d’un extremum global. Il faut alors un argument supplémentaire, comme une écriture en somme de carrés ou l’étude des limites.

5.3 Sur tout le plan : l’argument de coercivité

Sur \(\mathbb{R}^2\) entier, la compacité manque. Pourtant, on peut souvent s’y ramener. Supposons que \(f\) soit continue et tende vers \(+\infty\) quand \(\|x\|\) tend vers \(+\infty\) ; on dit alors que \(f\) est coercive.

Proposition :

Une fonction continue et coercive sur \(\mathbb{R}^n\) admet un minimum global.

Preuve :

Fixons un point \(x_0\). Par coercivité, il existe \(R > 0\) tel que \(f(x) > f(x_0)\) dès que \(\|x\| > R\). Quitte à augmenter \(R\), on peut supposer \(\|x_0\| \leqslant R\). Sur la boule fermée de rayon \(R\), qui est compacte, \(f\) atteint un minimum \(m \leqslant f(x_0)\). Hors de cette boule, \(f\) est strictement plus grande que \(f(x_0)\), donc que \(m\). Par conséquent, \(m\) est le minimum global.

Exemple guidé :

Soit \(f(x, y) = x^4 + y^2 – 4x – 2y\). D’abord, \(x^4 – 4x \geqslant -3\) et \(y^2 – 2y \geqslant -1\), et chacun de ces termes tend vers \(+\infty\) quand sa variable tend vers l’infini en valeur absolue. Or, si \(\|(x, y)\|\) devient grand, \(|x|\) ou \(|y|\) devient grand. Donc \(f\) est coercive. Ensuite, un minimum global existe et c’est un point critique, car \(\mathbb{R}^2\) est ouvert. Le système \(4x^3 – 4 = 0\), \(2y – 2 = 0\) a pour seule solution \((1, 1)\). Le minimum global vaut donc \(f(1, 1) = 1 + 1 – 4 – 2 = -4\), sans aucun calcul de hessienne.

Les erreurs fréquentes

  • Oublier des points critiques en simplifiant une équation par une quantité qui peut s’annuler.
  • Conclure qu’il n’y a pas d’extremum lorsque \(rt – s^2 = 0\), alors que le critère ne dit rien dans ce cas.
  • Annoncer un extremum global à partir d’un seul critère local.
  • Chercher les extrema sur un compact sans étudier le bord, ou en oubliant les sommets.
  • Confondre \(\frac{\partial^2 f}{\partial x^2}\) avec le carré \(\left(\frac{\partial f}{\partial x}\right)^2\).

Fiche mémo

  • Schwarz : si \(f\) est \(C^2\), les dérivées croisées sont égales et la hessienne est symétrique.
  • Taylor-Young : \(f(a + h) = f(a) + \nabla f(a) \cdot h + \frac{1}{2}h^{\top}H_f(a)h + o(\|h\|^2)\).
  • Extremum local en un point intérieur : le gradient y est nul.
  • Un point critique n’est pas forcément un extremum.
  • En deux variables : \(rt – s^2 > 0\) et \(r > 0\) donne un minimum local strict ; \(r < 0\) un maximum.
  • \(rt – s^2 < 0\) : point col ; \(rt – s^2 = 0\) : étude à la main.
  • Minimum local : hessienne positive (condition nécessaire).
  • Continue sur un compact : extrema globaux atteints, à l’intérieur en un point critique ou sur le bord.

Questions fréquentes

Le déterminant hessien s'annule en un point critique : comment conclure ?

Le critère d’ordre 2 ne permet alors pas de conclure. Il faut étudier la fonction à la main : restrictions à des droites ou à des courbes bien choisies, écriture comme somme de carrés, ou comparaison directe avec la valeur au point critique. Une seule direction où la fonction prend des valeurs plus petites et une autre où elle en prend de plus grandes suffisent à prouver qu’il n’y a pas d’extremum.

Un minimum local unique est-il forcément un minimum global ?

Non, en dimension 2 ce n’est pas automatique. Une fonction peut avoir un seul point critique, qui est un minimum local, et tendre vers moins l’infini dans une direction. Pour conclure à un extremum global, on utilise un argument supplémentaire : compacité, convexité, écriture comme somme de carrés ou étude des limites.

Pourquoi chercher les extrema sur le bord séparément ?

La condition nécessaire « gradient nul » ne vaut qu’en un point intérieur, où l’on peut se déplacer dans toutes les directions. Au bord, la fonction peut atteindre sa plus grande valeur sans que son gradient s’annule. On paramètre donc chaque morceau du bord et l’on étudie une fonction d’une variable, avant de comparer toutes les valeurs obtenues.

Le théorème de Schwarz est-il toujours vrai ?

Il exige que la fonction soit de classe C2 au voisinage du point. Sans cette hypothèse, les deux dérivées croisées peuvent exister et être différentes, comme le montre un contre-exemple du cours. En pratique, toutes les fonctions construites à partir des fonctions usuelles sur un ouvert de leur domaine sont de classe C2, et Schwarz s’applique.

Pour aller plus loin

Voter.. post
Télécharger puis imprimer cette fiche en PDF.

Télécharger ou imprimer cette fiche «hessienne et extrema libres en L2 de maths : cours et méthodes» au format PDF afin de pouvoir travailler en totale autonomie.


Nombre de fichiers PDF téléchargés.  Maths PDF c'est 16 224 758 cours et exercices de maths téléchargés en PDF et 4 250 exercices.

Télécharger les manuels scolaires de maths en PDF du CP à la Terminale