Multiplicateurs de Lagrange en L3 de maths : cours et méthodes

Multiplicateurs de Lagrange – Cours de maths en Licence 3 sur Maths-pdf.fr Couverture : Manuel de cours de maths L3 en PDF Télécharger en PDF Le livre des cours de maths en L3 PDF à imprimer Voir le livre ›


Ce cours sur les multiplicateurs Lagrange L3 rassemble tout ce qu’il faut pour trouver et justifier un extremum d’une fonction de plusieurs variables. Nous commençons par les extrema libres : points critiques, puis conditions du second ordre lues sur la Hessienne. Ensuite, nous expliquons pourquoi un minimum existe vraiment, grâce à la compacité ou à la coercivité.

Le cœur du chapitre est le théorème des extrema liés, démontré pas à pas à partir des fonctions implicites. Nous montrons aussi les situations où la méthode se tait, lorsque la contrainte n’est pas qualifiée. Enfin, la convexité transforme une condition nécessaire en condition suffisante, et le multiplicateur reçoit une interprétation concrète de sensibilité.

Ce chapitre prolonge le calcul différentiel du semestre et prépare l’analyse convexe, la mécanique et l’économie mathématique.

Ce que vous saurez faire

  • Trouver les points critiques d’une fonction de plusieurs variables et décider de leur nature avec la Hessienne.
  • Prouver qu’un minimum existe, par compacité ou par coercivité, avant tout calcul.
  • Résoudre un extremum lié en écrivant le système de Lagrange et en vérifiant la qualification de la contrainte.
  • Reconnaître les situations où la méthode de Lagrange échoue.
  • Utiliser la convexité pour transformer un point critique en minimum global.
  • Interpréter un multiplicateur comme la sensibilité de la valeur optimale.

1. Extrema libres sur un ouvert

Les fonctions étudiées ici sont à valeurs réelles, définies sur une partie ouverte \(U\) de \(\mathbb{R}^n\) ; nous les notons \(f\). Nous munissons \(\mathbb{R}^n\) de sa structure euclidienne usuelle. Ainsi, la différentielle \(df(a)\) s’identifie au gradient \(\nabla f(a)\) par la relation \(df(a)h = \langle \nabla f(a), h\rangle\).

Définition :

Soit \(A \subset U\) et \(a \in A\). On dit que \(f\) admet en \(a\) un minimum local sur \(A\) s’il existe \(r > 0\) tel que \(f(x) \geq f(a)\) pour tout \(x \in A\) vérifiant \(\|x – a\| < r\). Le minimum est global si l’inégalité vaut pour tout \(x \in A\). Il est strict si l’inégalité est stricte pour \(x \neq a\). On définit de même les maxima, et un extremum désigne un minimum ou un maximum.

1.1 La condition du premier ordre

Le premier outil est élémentaire. En effet, une fonction d’une variable dérivable atteint un extremum intérieur seulement là où sa dérivée s’annule. Nous ramenons donc le cas général à celui d’une variable, en restreignant \(f\) à des droites.

Théorème :

Si \(f\) est différentiable en \(a \in U\) et admet en \(a\) un extremum local sur l’ouvert \(U\), alors \(df(a) = 0\). On dit que \(a\) est un point critique de \(f\).

Preuve :

Choisissons une direction \(h \in \mathbb{R}^n\). L’ouvert \(U\) contient une boule centrée en \(a\), donc \(\varphi(t) = f(a + th)\) a un sens pour \(|t|\) assez petit. La règle de composition donne \(\varphi^{\prime}(0) = df(a)h\). De plus, \(\varphi\) admet un extremum local en \(0\), qui est intérieur. Par conséquent \(\varphi^{\prime}(0) = 0\), donc \(df(a)h = 0\). Ceci vaut pour tout \(h\), d’où \(df(a) = 0\).

Piège à éviter :

L’hypothèse « \(U\) ouvert » est essentielle. Sur le segment \([0,1]\), la fonction \(x \mapsto x\) atteint son minimum en \(0\) avec une dérivée égale à \(1\). Ainsi, sur un fermé, on étudie séparément l’intérieur et le bord. Inversement, un point critique n’est pas forcément un extremum : l’origine pour \(x \mapsto x^3\) le montre déjà.

1.2 Les conditions du second ordre

Supposons maintenant \(f\) de classe \(C^2\). Notons \(H_f(a)\) sa matrice Hessienne, symétrique d’après le théorème de Schwarz. La formule de Taylor-Young à l’ordre deux en un point critique s’écrit alors :

\[ f(a+h) = f(a) + \tfrac{1}{2}\, h^{T} H_f(a)\, h + o\big(\|h\|^2\big). \]

Le signe de \(f(a+h) – f(a)\) dépend donc d’abord de la forme quadratique \(h \mapsto h^{T} H_f(a) h\). C’est pourquoi on obtient deux énoncés, l’un nécessaire et l’autre suffisant.

Théorème :

Soit \(f\) de classe \(C^2\) sur \(U\) et \(a\) un point critique.

  1. Si \(f\) admet un minimum local en \(a\), alors \(H_f(a)\) est positive.
  2. Si \(H_f(a)\) est définie positive, alors \(f\) admet un minimum local strict en \(a\).
  3. Si le spectre de \(H_f(a)\) contient deux réels de signes contraires, non nuls, alors \(f\) prend près de \(a\) des valeurs plus grandes et plus petites que \(f(a)\) : on parle de point col.
Preuve :

Pour le point 1, nous appliquons Taylor-Young à \(h = tv\) avec \(v\) fixé : \(0 \leq f(a+tv) – f(a) = \tfrac{t^2}{2} v^{T}H_f(a)v + o(t^2)\). Après division par \(t^2\), le passage à la limite \(t \to 0\) livre \(v^{T}H_f(a)v \geq 0\). Pour le point 2, notons \(\mu > 0\) la plus petite valeur propre de \(H_f(a)\). Alors \(h^{T}H_f(a)h \geq \mu\|h\|^2\), donc \(f(a+h) – f(a) \geq \big(\tfrac{\mu}{2} – \varepsilon(h)\big)\|h\|^2\) avec \(\varepsilon(h) \to 0\). Ce terme est strictement positif pour \(h\) petit et non nul. Enfin, le point 3 découle du point 1 appliqué à \(f\) et à \(-f\).

En dimension deux, on note traditionnellement \(r = \partial_{xx} f(a)\), \(s = \partial_{xy} f(a)\) et \(t = \partial_{yy} f(a)\). Le déterminant \(rt – s^2\) est le produit des valeurs propres, et la trace \(r + t\) leur somme. Par conséquent, si \(rt – s^2 > 0\) et \(r > 0\), on a un minimum local strict. Si \(rt – s^2 > 0\) et \(r < 0\), on a un maximum local strict. Enfin, si \(rt – s^2 < 0\), on a un point col.

Exemple guidé :

Étudions \(f(x,y) = x^3 + y^2 – 2xy – x\) sur \(\mathbb{R}^2\). Les dérivées partielles valent \(\partial_x f = 3x^2 – 2y – 1\) et \(\partial_y f = 2y – 2x\). La seconde équation impose \(y = x\). La première devient alors \(3x^2 – 2x – 1 = 0\), dont les racines sont \(1\) et \(-\tfrac{1}{3}\). On trouve donc deux points critiques, \((1,1)\) et \(\big(-\tfrac{1}{3}, -\tfrac{1}{3}\big)\).

Ensuite, la Hessienne vaut \(\begin{pmatrix} 6x & -2 \\ -2 & 2 \end{pmatrix}\), de déterminant \(12x – 4\). En \((1,1)\), le déterminant vaut \(8 > 0\) et \(r = 6 > 0\) : c’est un minimum local strict, de valeur \(f(1,1) = -1\). En \(\big(-\tfrac{1}{3}, -\tfrac{1}{3}\big)\), le déterminant vaut \(-8\) : c’est un point col. Enfin, le minimum local n’est pas global, car \(f(x,0) = x^3 – x\) tend vers \(-\infty\) quand \(x \to -\infty\).

La figure suivante montre les lignes de niveau de cette fonction. Les courbes fermées entourent le minimum local, tandis que deux lignes se croisent au point col.

Lignes de niveau d'une fonction de deux variables avec un minimum local et un point col
Contre-exemple :

Lorsque la Hessienne est seulement positive, on ne peut rien conclure. Par exemple, \(f_1(x,y) = x^2 + y^4\) et \(f_2(x,y) = x^2 – y^4\) ont la même Hessienne \(\mathrm{diag}(2,0)\) à l’origine. Pourtant, \(f_1\) y admet un minimum strict, alors que \(f_2\) prend des valeurs négatives sur l’axe des ordonnées. Il faut alors revenir à la fonction elle-même.

2. Existence d’un extremum : compacité et coercivité

Les conditions précédentes sont locales. Elles ne disent jamais qu’un minimum global existe. Or, dans un exercice, on cherche presque toujours un extremum global. Nous commençons donc par un argument d’existence, puis nous localisons le point avec le calcul différentiel.

2.1 Le cas compact

Théorème :

Une fonction continue sur une partie compacte non vide \(K\) de \(\mathbb{R}^n\) est bornée et atteint ses bornes. En dimension finie, les compacts sont exactement les fermés bornés.

Ce résultat, établi dans le chapitre de topologie, suffit pour les contraintes bornées : sphères, ellipses, simplexes, boules fermées. En revanche, une droite, une parabole ou une hyperbole ne sont pas bornées. Il faut alors un autre argument.

2.2 Fonctions coercives

Définition :

Soit \(F\) une partie fermée non bornée de \(\mathbb{R}^n\). Une fonction \(f : F \to \mathbb{R}\) est coercive sur \(F\) si \(f(x) \to +\infty\) lorsque \(\|x\| \to +\infty\) avec \(x \in F\). Autrement dit, pour tout \(M\), il existe \(R\) tel que \(f(x) \geq M\) dès que \(x \in F\) et \(\|x\| \geq R\).

Théorème :

Une fonction continue et coercive sur un fermé non vide \(F\) de \(\mathbb{R}^n\) admet un minimum global sur \(F\).

Preuve :

Fixons \(x_0 \in F\) et posons \(M = f(x_0)\). Par coercivité, il existe \(R\) tel que \(f(x) > M\) pour \(x \in F\) et \(\|x\| \geq R\). Quitte à augmenter \(R\), on peut supposer \(\|x_0\| < R\). Ensuite, l’ensemble \(K = F \cap \overline{B}(0,R)\) est fermé et borné, donc compact, et il contient \(x_0\). Ainsi, \(f\) atteint sur \(K\) un minimum en un point \(x^{*}\), avec \(f(x^{*}) \leq f(x_0) = M\). Enfin, hors de \(K\), on a \(f(x) > M \geq f(x^{*})\). Par conséquent, \(x^{*}\) réalise le minimum de \(f\) sur tout \(F\).

Comment faire :

Pour déterminer le minimum global d’une fonction \(C^1\) sur \(\mathbb{R}^n\) :

  1. Prouver l’existence, en général par coercivité. Pour cela, minorer \(f\) par une fonction simple qui tend vers \(+\infty\).
  2. Remarquer que le minimum est atteint en un point de l’ouvert \(\mathbb{R}^n\), donc en un point critique.
  3. Résoudre \(\nabla f = 0\) et calculer \(f\) en chaque point critique.
  4. Conclure : le minimum global est la plus petite de ces valeurs.

Cette méthode évite toute étude de Hessienne pour le minimum global.

Exemple guidé :

Cherchons le minimum de \(f(x,y) = x^4 + 2y^2 – 4xy\) sur \(\mathbb{R}^2\). D’abord, l’inégalité \(4xy \leq 4x^2 + y^2\) donne \(f(x,y) \geq (x^4 – 4x^2) + y^2\). Or \(x^4 – 4x^2 = (x^2 – 2)^2 – 4 \geq -4\). Si \(x^2 + y^2 \geq 2R^2\), alors \(x^2 \geq R^2\) ou \(y^2 \geq R^2\). Dans le premier cas, \(f \geq R^4 – 4R^2\) pour \(R^2 \geq 2\) ; dans le second, \(f \geq R^2 – 4\). Dans les deux cas, la minoration tend vers \(+\infty\) : \(f\) est coercive.

Ensuite, les points critiques vérifient \(4x^3 – 4y = 0\) et \(4y – 4x = 0\). Donc \(y = x\) et \(x^3 = x\), ce qui donne \((0,0)\), \((1,1)\) et \((-1,-1)\). Comme \(f(0,0) = 0\) et \(f(1,1) = f(-1,-1) = -1\), le minimum global vaut \(-1\). Il est atteint exactement en \((1,1)\) et \((-1,-1)\).

Remarque :

L’origine n’est pas un extremum local. En effet, la Hessienne y vaut \(\begin{pmatrix} 0 & -4 \\ -4 & 4 \end{pmatrix}\), de déterminant \(-16 < 0\). L’argument d’existence a donc évité une étude locale inutile.

3. Extrema liés et multiplicateurs de Lagrange

Passons aux problèmes avec contraintes. La fonction \(f\) est désormais étudiée seulement sur l’ensemble \(Z = \{x \in U : g_1(x) = \dots = g_p(x) = 0\}\), avec \(p < n\). Un tel ensemble est d’intérieur vide en général. Par conséquent, la condition \(\nabla f(a) = 0\) n’a plus de raison d’être vérifiée. Il faut une condition adaptée à la géométrie de \(Z\).

3.1 Contraintes qualifiées et espace tangent

Notons \(g = (g_1, \dots, g_p) : U \to \mathbb{R}^p\), supposée de classe \(C^1\).

Définition :

La contrainte est qualifiée en \(a \in Z\) si \(dg(a)\) est surjective. De façon équivalente, la famille \(\big(\nabla g_i(a)\big)_{1 \leq i \leq p}\) est libre. On appelle alors espace tangent à \(Z\) en \(a\) le sous-espace \(T_a Z = \ker dg(a)\), de dimension \(n – p\).

Ce nom se justifie par le lemme suivant. Il repose sur le théorème des fonctions implicites, vu au chapitre précédent.

Lemme :

Si la contrainte est qualifiée en \(a\), alors pour tout \(v \in \ker dg(a)\), il existe \(\varepsilon > 0\) et une courbe \(\gamma : \left]-\varepsilon, \varepsilon\right[ \to Z\) de classe \(C^1\) telle que \(\gamma(0) = a\) et \(\gamma^{\prime}(0) = v\).

Preuve :

Comme \(dg(a)\) est surjective, on peut numéroter les coordonnées pour que la matrice des dérivées de \(g\) par rapport aux \(p\) dernières variables soit inversible en \(a\). Écrivons \(x = (u, w)\) avec \(u \in \mathbb{R}^{n-p}\) et \(w \in \mathbb{R}^p\), puis \(a = (u_0, w_0)\). Le théorème des fonctions implicites fournit alors une fonction \(\psi\) de classe \(C^1\) telle que, près de \(a\), \(g(u,w) = 0\) équivaut à \(w = \psi(u)\). Écrivons \(v = (v_u, v_w)\) et posons \(\gamma(t) = \big(u_0 + t v_u, \psi(u_0 + t v_u)\big)\). Cette courbe reste dans \(Z\) et \(\gamma^{\prime}(0) = \big(v_u, d\psi(u_0)v_u\big)\). Enfin, en dérivant \(g(u, \psi(u)) = 0\), on voit que \(\gamma^{\prime}(0) \in \ker dg(a)\). Or un vecteur de ce noyau est déterminé par sa composante \(v_u\), car le bloc relatif à \(w\) est inversible. Donc \(\gamma^{\prime}(0) = v\).

3.2 Le théorème des extrema liés

Nous aurons besoin d’un résultat d’algèbre linéaire, que l’on démontre par dualité.

Lemme :

Soient \(\ell, \varphi_1, \dots, \varphi_p\) des formes linéaires sur \(\mathbb{R}^n\). Si \(\ker \varphi_1 \cap \dots \cap \ker \varphi_p \subset \ker \ell\), alors \(\ell\) est combinaison linéaire de \(\varphi_1, \dots, \varphi_p\).

Preuve :

Considérons \(\Phi = (\varphi_1, \dots, \varphi_p) : \mathbb{R}^n \to \mathbb{R}^p\). L’hypothèse dit que \(\ell\) est nulle sur \(\ker \Phi\). Ainsi, \(\ell\) se factorise par l’image : il existe une forme linéaire \(m\) sur \(\mathrm{Im}\, \Phi\) telle que \(\ell = m \circ \Phi\). On prolonge \(m\) en une forme linéaire sur \(\mathbb{R}^p\), qui s’écrit \(m(y) = \lambda_1 y_1 + \dots + \lambda_p y_p\). Finalement, \(\ell = \lambda_1 \varphi_1 + \dots + \lambda_p \varphi_p\).

Théorème :

Soient \(f\) et \(g\) de classe \(C^1\) sur \(U\), et \(a \in Z\) un point où la contrainte est qualifiée. On suppose que la restriction \(f_{|Z}\) présente en \(a\) un extremum local. Alors il existe un unique \((\lambda_1, \dots, \lambda_p) \in \mathbb{R}^p\) tel que

\[ \nabla f(a) = \lambda_1 \nabla g_1(a) + \dots + \lambda_p \nabla g_p(a). \]

Les réels \(\lambda_i\) s’appellent les multiplicateurs de Lagrange associés au point \(a\).

Preuve :

Soit \(v \in \ker dg(a)\). D’après le premier lemme, il existe une courbe \(\gamma\) tracée sur \(Z\), avec \(\gamma(0) = a\) et \(\gamma^{\prime}(0) = v\). Ensuite, la fonction \(t \mapsto f(\gamma(t))\) est dérivable et admet un extremum local en \(0\), qui est intérieur à son intervalle de définition. Sa dérivée en \(0\) est donc nulle, c’est-à-dire \(df(a)v = 0\). Nous avons ainsi prouvé \(\ker dg(a) \subset \ker df(a)\). Le second lemme fournit alors les \(\lambda_i\). Enfin, l’unicité vient de ce que les \(\nabla g_i(a)\) forment une famille libre.

Géométriquement, le théorème dit qu’en un extremum lié, le gradient de \(f\) est orthogonal à l’espace tangent. Avec une seule contrainte dans le plan, la ligne de niveau de \(f\) passant par \(a\) est donc tangente à la courbe \(Z\).

3.3 La méthode en pratique

Comment faire :

Pour trouver les extrema globaux de \(f\) sur \(Z = \{g = 0\}\) :

  1. Justifier l’existence : \(Z\) compact, ou \(f\) coercive sur le fermé \(Z\).
  2. Repérer les points de \(Z\) où la contrainte n’est pas qualifiée. Ce sont des candidats à part entière.
  3. Aux autres points, poser le lagrangien \(L(x, \lambda) = f(x) – \sum \lambda_i g_i(x)\) et résoudre \(\nabla_x L = 0\) avec \(g(x) = 0\).
  4. Calculer \(f\) en tous les candidats et comparer les valeurs.
Exemple guidé :

Cherchons les extrema de \(f(x,y) = 3x + 4y\) sur l’ellipse \(Z : x^2 + 4y^2 = 13\). D’abord, \(Z\) est fermée et bornée, donc compacte, et \(f\) est continue : les deux extrema existent. Ensuite, avec \(g(x,y) = x^2 + 4y^2 – 13\), on a \(\nabla g = (2x, 8y)\). Ce vecteur s’annule seulement en \((0,0)\), qui n’est pas sur \(Z\). La contrainte est donc qualifiée partout.

Le système de Lagrange s’écrit \(3 = 2\lambda x\) et \(4 = 8\lambda y\). Ainsi \(\lambda \neq 0\), puis \(x = \tfrac{3}{2\lambda}\) et \(y = \tfrac{1}{2\lambda}\). En reportant dans la contrainte, on obtient \(\tfrac{9}{4\lambda^2} + \tfrac{4}{4\lambda^2} = 13\), donc \(\lambda^2 = \tfrac{1}{4}\). Pour \(\lambda = \tfrac{1}{2}\), on trouve \((3,1)\) et \(f = 13\). Pour \(\lambda = -\tfrac{1}{2}\), on trouve \((-3,-1)\) et \(f = -13\). Par conséquent, le maximum vaut \(13\) et le minimum \(-13\).

La figure illustre la tangence. Les droites de niveau \(3x + 4y = c\) balaient le plan, et les valeurs extrêmes correspondent aux deux droites qui touchent l’ellipse.

Droites de niveau d'une fonction affine tangentes à une ellipse aux deux points extrêmes

Piège à éviter :

Le système de Lagrange fournit des candidats, pas des extrema. Un point solution peut n’être ni un minimum ni un maximum sur \(Z\). Il ne faut donc jamais conclure sans argument d’existence suivi d’une comparaison des valeurs. De même, on n’oublie pas l’inconnue \(\lambda\) : on a \(n + p\) équations pour \(n + p\) inconnues.

3.4 Quand la méthode de Lagrange échoue

L’hypothèse de qualification n’est pas une précaution de style. Sans elle, le théorème devient faux, comme le montre l’exemple suivant.

Contre-exemple :

Minimisons \(f(x,y) = y\) sur la courbe \(Z : x^2 = y^3\). Sur \(Z\), on a \(y^3 = x^2 \geq 0\), donc \(y \geq 0\). Le minimum vaut donc \(0\) et il est atteint en \((0,0)\) seulement. Cependant, avec \(g(x,y) = x^2 – y^3\), le système \(\nabla f = \lambda \nabla g\) s’écrit \(0 = 2\lambda x\) et \(1 = -3\lambda y^2\). La seconde équation impose \(\lambda \neq 0\) et \(y \neq 0\). La première donne alors \(x = 0\), puis la contrainte donne \(y = 0\) : c’est une contradiction. Le système n’a aucune solution, alors que le minimum existe. L’explication est simple : \(\nabla g(0,0) = (0,0)\), donc la contrainte n’est pas qualifiée à l’origine.

La courbe \(Z\) présente en effet un point de rebroussement à l’origine. Aucune droite tangente n’y est définie, comme le montre la figure.

Courbe de contrainte avec un point de rebroussement où le gradient de la contrainte est nul

Remarque :

Il existe une version qui couvre ce cas : en tout extremum lié, il existe \((\lambda_0, \lambda) \neq (0,0)\) tel que \(\lambda_0 \nabla f(a) = \sum \lambda_i \nabla g_i(a)\). Dans l’exemple, \(\lambda_0 = 0\) convient. Cette forme, dite de Fritz John, est hors programme ; elle explique pourquoi les points non qualifiés restent des candidats.

3.5 Une condition du second ordre pour les extrema liés

Supposons \(f\) et \(g\) de classe \(C^2\), et soit \((a, \lambda)\) une solution du système de Lagrange. On note \(H_L(a)\) la Hessienne en \(x\) du lagrangien \(L(\cdot, \lambda)\).

Proposition :

Si la contrainte est qualifiée en \(a\) et si \(v^{T} H_L(a) v > 0\) pour tout vecteur non nul \(v \in T_a Z\), alors \(f\) restreinte à \(Z\) admet un minimum local strict en \(a\).

Seule compte la restriction de la forme quadratique à l’espace tangent. Ainsi, la Hessienne de \(L\) peut très bien être indéfinie sur \(\mathbb{R}^n\) tout entier. L’exercice 14 de la fiche en donne un exemple. En pratique, cependant, la comparaison des valeurs reste la méthode la plus sûre pour un extremum global.

4. Convexité et minimisation

Jusqu’ici, toutes nos conditions étaient nécessaires. La convexité change la situation : pour une fonction convexe, un point critique est automatiquement un minimum global. C’est pourquoi elle joue un rôle central en optimisation.

4.1 Fonctions convexes différentiables

Définition :

On se donne \(C \subset \mathbb{R}^n\) convexe et \(f : C \to \mathbb{R}\). La fonction \(f\) mérite le nom de convexe lorsque \(f\big(\theta x + (1-\theta) y\big) \leq \theta f(x) + (1-\theta) f(y)\) quels que soient les points \(x, y\) de \(C\) et le poids \(\theta \in [0,1]\). On réserve le qualificatif strictement convexe au cas où cette inégalité devient stricte dès que \(x \neq y\) et \(0 < \theta < 1\).

Théorème :

Soit \(f\) différentiable sur un ouvert convexe \(U\). Alors \(f\) est convexe si et seulement si, pour tous \(x, y \in U\) :

\[ f(y) \geq f(x) + df(x)(y – x). \]

Autrement dit, le graphe de \(f\) est au-dessus de chacun de ses hyperplans tangents.

Preuve :

Supposons \(f\) convexe. Pour \(0 < t \leq 1\), la convexité appliquée au point \(x + t(y – x)\) donne \(f\big(x + t(y-x)\big) – f(x) \leq t\big(f(y) – f(x)\big)\). On divise par \(t\) puis on fait tendre \(t\) vers \(0\). Le membre de gauche tend vers \(df(x)(y-x)\), d’où l’inégalité. Réciproquement, soit \(z = \theta x + (1-\theta)y\). On écrit l’inégalité en \(z\) vers \(x\), puis en \(z\) vers \(y\). On multiplie la première par \(\theta\) et la seconde par \(1 – \theta\), puis on additionne. Les termes en \(df(z)\) se compensent, car \(\theta(x – z) + (1-\theta)(y – z) = 0\). Il reste \(\theta f(x) + (1-\theta) f(y) \geq f(z)\).

Corollaire :

Pour \(f\) de classe \(C^2\) sur un ouvert convexe \(U\), la convexité équivaut à la positivité de la matrice \(H_f(x)\) pour chaque \(x \in U\). Lorsque toutes ces matrices sont même définies positives, \(f\) est strictement convexe.

Pour le démontrer, on se ramène à une variable avec \(\varphi(t) = f(x + th)\), dont la dérivée seconde vaut \(h^{T} H_f(x + th) h\). En effet, une fonction d’une variable est convexe exactement quand sa dérivée seconde est positive.

La figure ci-dessous montre une fonction convexe d’une variable et trois de ses tangentes. Chaque tangente reste sous la courbe.

Graphe d'une fonction convexe situé au-dessus de trois de ses droites tangentes

4.2 Le minimum d’une fonction convexe

Théorème :

Soit \(f\) convexe et différentiable sur un ouvert convexe \(U\).

  1. Chaque point où \(df\) s’annule réalise le minimum global de \(f\) sur \(U\).
  2. Avec la convexité stricte, l’ensemble des points de minimum compte zéro ou un élément.
  3. Sur \(U = \mathbb{R}^n\), une fonction à la fois strictement convexe et coercive possède un et un seul point de minimum.
Preuve :

Si \(df(a) = 0\), l’inégalité de convexité donne \(f(y) \geq f(a)\) pour tout \(y\), d’où le point 1. Pour le point 2, supposons deux points de minimum distincts \(a\) et \(b\), de valeur commune \(m\). Alors \(f\big(\tfrac{a+b}{2}\big) < \tfrac{m + m}{2} = m\), ce qui contredit la minimalité. Enfin, le point 3 combine l’existence par coercivité et l’unicité du point 2.

Exemple guidé :

Soit \(f(x,y) = \mathrm{ch}\, x + y^2 – xy\). Sa Hessienne vaut \(\begin{pmatrix} \mathrm{ch}\, x & -1 \\ -1 & 2 \end{pmatrix}\). Son déterminant vaut \(2\,\mathrm{ch}\, x – 1 \geq 1\) et sa trace est strictement positive. La Hessienne est donc définie positive partout : \(f\) est strictement convexe. Ensuite, les points critiques vérifient \(\mathrm{sh}\, x = y\) et \(2y = x\), donc \(x = 2\,\mathrm{sh}\, x\). Or \(\mathrm{sh}\, x\) a le signe de \(x\) et \(|\mathrm{sh}\, x| \geq |x|\), donc cette équation impose \(x = 0\). Le seul point critique est \((0,0)\). Par conséquent, \(f\) admet en \((0,0)\) son unique point de minimum global, de valeur \(1\).

Contre-exemple :

Deux confusions sont fréquentes. D’abord, l’exponentielle est strictement convexe sur \(\mathbb{R}\) mais n’a pas de minimum : la convexité ne garantit pas l’existence. Ensuite, \(f(x,y) = 3xy\) est affine en chaque variable séparément, donc convexe en chacune. Pourtant, \(f\) n’est pas convexe : sur la droite \(y = -x\), elle vaut \(-3x^2\), fonction concave. Sa Hessienne \(\begin{pmatrix} 0 & 3 \\ 3 & 0 \end{pmatrix}\) a d’ailleurs pour valeurs propres \(3\) et \(-3\).

4.3 Convexité et contraintes affines

Proposition :

Soit \(f\) convexe et différentiable sur \(\mathbb{R}^n\), et \(Z = \{x : Ax = b\}\) un sous-espace affine non vide, avec \(A\) une matrice \(p \times n\). Si \(a \in Z\) vérifie \(\nabla f(a) = A^{T}\lambda\) pour un \(\lambda \in \mathbb{R}^p\), alors \(a\) est un minimum global de \(f\) sur \(Z\).

Preuve :

Soit \(y \in Z\). Alors \(A(y – a) = b – b = 0\). Ainsi \(df(a)(y-a) = \langle A^{T}\lambda, y – a\rangle = \langle \lambda, A(y-a)\rangle = 0\). L’inégalité de convexité donne alors \(f(y) \geq f(a)\).

Ici, aucune hypothèse de qualification n’est nécessaire, car on prouve directement la minimalité. Le résultat transforme donc la condition de Lagrange en condition suffisante.

Exemple guidé :

Minimisons \(f(x,y,z) = x^2 + 2y^2 + 3z^2\) sous la contrainte \(x + y + z = 11\). La fonction \(f\) est convexe, car sa Hessienne \(\mathrm{diag}(2,4,6)\) est définie positive. Le système de Lagrange s’écrit \(2x = \lambda\), \(4y = \lambda\) et \(6z = \lambda\). Ainsi \(x + y + z = \lambda\big(\tfrac{1}{2} + \tfrac{1}{4} + \tfrac{1}{6}\big) = \tfrac{11\lambda}{12}\). La contrainte donne alors \(\lambda = 12\), puis le point \((6, 3, 2)\). D’après la proposition, ce point réalise le minimum global, qui vaut \(36 + 18 + 12 = 66\).

5. Interpréter les multiplicateurs de Lagrange

Le multiplicateur n’est pas seulement une inconnue auxiliaire. Il mesure la réaction de la valeur optimale lorsqu’on déplace la contrainte. Nous l’établissons pour une seule contrainte, sous des hypothèses de régularité commodes.

5.1 La formule de sensibilité

Proposition :

Pour \(c\) dans un intervalle ouvert \(I\), notons \(V(c)\) la valeur optimale de \(f\) sur \(Z_c = \{g = c\}\). Supposons qu’elle soit atteinte en un point \(x(c)\), avec un multiplicateur \(\lambda(c)\), et que \(c \mapsto x(c)\) soit de classe \(C^1\). Alors \(V\) est dérivable et

\[ V^{\prime}(c) = \lambda(c). \]

Preuve :

On a \(V(c) = f(x(c))\). La règle de dérivation des fonctions composées donne \(V^{\prime}(c) = df(x(c))\,x^{\prime}(c)\). Or \(df(x(c)) = \lambda(c)\, dg(x(c))\). De plus, en dérivant l’identité \(g(x(c)) = c\), on obtient \(dg(x(c))\,x^{\prime}(c) = 1\). Par conséquent, \(V^{\prime}(c) = \lambda(c)\).

Reprenons l’exemple précédent avec une contrainte \(x + y + z = c\). Le même calcul donne \(\lambda = \tfrac{12c}{11}\) et le point \(\big(\tfrac{6c}{11}, \tfrac{3c}{11}, \tfrac{2c}{11}\big)\). On en déduit \(V(c) = \tfrac{6c^2}{11}\), puis \(V^{\prime}(11) = 12\), qui est bien le multiplicateur trouvé. Autrement dit, relever la contrainte de \(11\) à \(11{,}1\) augmente le minimum d’environ \(12 \times 0{,}1 = 1{,}2\).

La figure trace la valeur optimale \(V\) en fonction de \(c\) et sa tangente en \(c = 11\). La pente de cette tangente est exactement le multiplicateur.

Valeur optimale en fonction du niveau de contrainte avec sa tangente dont la pente vaut le multiplicateur

5.2 Lecture concrète

En économie, \(f\) représente souvent un coût ou un profit, et \(c\) une ressource disponible. Le multiplicateur s’appelle alors le prix implicite de la ressource. Il indique ce que rapporterait, à la marge, une unité supplémentaire. En mécanique, de même, le multiplicateur associé à une liaison s’interprète comme une force de réaction.

À savoir :

Le signe d’un multiplicateur dépend de la convention d’écriture. Avec \(L = f – \lambda(g – c)\), on a \(V^{\prime}(c) = \lambda\). Avec \(L = f + \lambda(g – c)\), on a au contraire \(V^{\prime}(c) = -\lambda\). Il faut donc toujours préciser la convention avant d’interpréter le signe.

Piège à éviter :

La formule \(V^{\prime}(c) = \lambda(c)\) suppose une dépendance régulière du point optimal. Lorsque plusieurs points réalisent l’optimum, \(V\) peut avoir un point anguleux. Par exemple, \(V(c) = |c|\) n’est pas dérivable en \(0\). Dans ce cas, on parle seulement de dérivées à gauche et à droite.

Les erreurs fréquentes

  • Conclure qu’un point critique est un minimum sans argument d’existence ni étude de Hessienne.
  • Oublier les points de la contrainte où les gradients \(\nabla g_i\) sont liés ou nuls.
  • Appliquer la condition \(\nabla f = 0\) sur un fermé, alors qu’elle ne vaut qu’à l’intérieur.
  • Croire qu’une Hessienne positive mais non définie prouve un minimum local.
  • Penser qu’une fonction strictement convexe atteint toujours son minimum.
  • Interpréter le signe d’un multiplicateur sans préciser la convention du lagrangien.

Fiche mémo

  • Condition du premier ordre : à l’intérieur du domaine, tout extremum local annule le gradient.
  • En un point critique, Hessienne définie positive : minimum local strict ; valeurs propres de signes opposés : point col.
  • En dimension deux : \(rt – s^2 > 0\) et \(r > 0\) donne un minimum, \(rt – s^2 < 0\) un col.
  • Existence : continuité sur un compact, ou continuité et coercivité sur un fermé.
  • Contrainte qualifiée en \(a\) : \(dg(a)\) surjective, espace tangent \(\ker dg(a)\).
  • Extremum lié en un point qualifié : le gradient de \(f\) appartient à \(\mathrm{Vect}\big(\nabla g_1(a), \dots, \nabla g_p(a)\big)\), les coefficients étant les multiplicateurs.
  • Les points non qualifiés restent des candidats ; on compare toujours les valeurs.
  • Convexité : \(f(y) \geq f(x) + df(x)(y-x)\) ; un point critique est un minimum global.
  • Strictement convexe et coercive sur \(\mathbb{R}^n\) : un unique point de minimum.
  • Sensibilité : \(V^{\prime}(c) = \lambda\) pour la contrainte \(g = c\) et le lagrangien \(f – \lambda(g – c)\).

Questions fréquentes

Le système de Lagrange donne-t-il toujours les extrema ?

Non. Il donne une condition nécessaire, valable seulement aux points où la contrainte est qualifiée, c’est-à-dire où sa différentielle est surjective. Il faut donc examiner à part les points où les gradients des contraintes sont liés, puis comparer les valeurs obtenues.

Comment savoir si un point de Lagrange est un minimum ?

Le plus sûr est de prouver d’abord l’existence d’un minimum par compacité ou coercivité, puis de comparer les valeurs de f aux points candidats. On peut aussi utiliser la convexité, ou étudier la Hessienne du lagrangien restreinte à l’espace tangent.

Quel est le signe du multiplicateur ?

Le signe dépend de la façon d’écrire le lagrangien et la contrainte. Avec une contrainte g = c, le multiplicateur mesure la dérivée de la valeur optimale par rapport à c. Ce nombre peut donc être positif ou négatif, et il n’y a aucune règle de signe pour une contrainte d’égalité.

Une fonction convexe atteint-elle toujours son minimum ?

Non : l’exponentielle est strictement convexe sur R et n’a pas de minimum. Il faut ajouter une hypothèse d’existence, par exemple la coercivité. En revanche, si un point critique existe, la convexité garantit qu’il réalise le minimum global.

Pour aller plus loin

Voter.. post
Télécharger puis imprimer cette fiche en PDF.

Télécharger ou imprimer cette fiche «multiplicateurs de Lagrange en L3 de maths : cours et méthodes» au format PDF afin de pouvoir travailler en totale autonomie.


Nombre de fichiers PDF téléchargés.  Maths PDF c'est 16 224 640 cours et exercices de maths téléchargés en PDF et 4 250 exercices.

Télécharger les manuels scolaires de maths en PDF du CP à la Terminale