math-concepts

Comprendre intuitivement les dérivées partielles (une pente dans une direction)

29 août 202612 min de lecture
Comprendre intuitivement les dérivées partielles (une pente dans une direction)

Une dérivée ordinaire est la pente d'une courbe. Une entrée, une sortie, et en chaque point un seul nombre qui dit à quelle vitesse la sortie change. Cette image s'effondre dès que la fonction a deux entrées. Un graphe en trois dimensions est une surface, pas une courbe, et une surface n'a pas une seule pente. Du même point on peut marcher vers l'est et trouver une montée douce, ou vers le nord et trouver une descente.

La dérivée partielle est le remplacement honnête. Elle répond à une question plus étroite: si je tiens toutes les autres entrées immobiles et que je marche seulement dans cette direction, quelle est la pente? Le reste du chapitre, les dérivées croisées, le gradient, la règle de chaîne à plusieurs variables, c'est la même question posée le long de plusieurs chemins.

Une surface n'a pas une seule pente

Une fonction d'une variable trace une courbe dans le plan. Une fonction de deux variables, f(x, y), trace une surface dans l'espace. Chaque couple (x, y) est un point du sol, et f(x, y) est la hauteur du toit au-dessus de ce point.

Prenez le bol

f(x,y)=x2+y2f(x, y) = x^{2} + y^{2}

À l'origine la hauteur vaut 0. En (1, 0) elle vaut 1. En (0, 2) elle vaut 4. En (1, 2) elle vaut 5. Debout en (1, 2), aucun nombre unique ne mérite le nom de « la pente ». Marchez en x et le toit continue de monter. Marchez en y et il monte plus vite. Marchez en diagonale et vous obtenez un mélange des deux.

C'est pourquoi les étudiants qui maîtrisent l'analyse à une variable sentent le sol se dérober. La dérivée à laquelle ils se fiaient était une description complète du changement local. Sur une surface, ce n'est que la description d'une promenade choisie.

Les cartes météo et les cartes topographiques utilisent déjà l'idée. Une courbe de niveau est un ensemble de points à la même hauteur. Là où les courbes se serrent, la surface est raide. Là où elles s'écartent, elle est douce. Une dérivée partielle est la pente que vous mesureriez en suivant une ligne de grille sur cette carte et en ignorant l'autre.

Immobilisez une entrée

Le geste qui rend la surface lisible est une tranche.

Fixez y à une constante, disons y = 2, et ne regardez que comment la hauteur dépend de x. La fonction se réduit à

g(x)=f(x,2)=x2+4g(x) = f(x, 2) = x^{2} + 4

une parabole ordinaire posée quatre unités au-dessus de l'axe des x. Sa dérivée est 2x. Ce nombre est la dérivée partielle de f par rapport à x, évaluée le long de la droite y = 2. En x = 1 elle vaut 2: si vous êtes en (1, 2) et faites un tout petit pas en x, le toit monte d'environ 2 unités de hauteur par unité de pas.

Fixez plutôt x, disons x = 1, et la tranche est

h(y)=1+y2h(y) = 1 + y^{2}

de dérivée 2y. En y = 2 cette pente vaut 4. Même point, autre promenade, autre pente. Il n'y a pas de contradiction. Vous avez posé deux questions différentes.

Le calcul reprend la règle de l'analyse à une variable. Pour trouver fx\frac{\partial f}{\partial x}, traitez y comme une constante et dérivez en x. Pour trouver fy\frac{\partial f}{\partial y}, traitez x comme une constante et dérivez en y. Pour le bol, fx\frac{\partial f}{\partial x} = 2x et fy\frac{\partial f}{\partial y} = 2y. L'autre variable n'apparaît même pas, car chaque terme de x2+y2x^{2} + y^{2} ne dépend que d'une entrée. Dans un produit comme 3x23x^{2}y les deux entrées sont là: x\frac{\partial}{\partial x} donne 6xy, parce que 3y est un coefficient fixe de x2x^{2}, et y\frac{\partial}{\partial y} donne 3x23x^{2}, parce que 3x23x^{2} est un coefficient fixe de y.

La phrase « tenez l'autre variable constante » n'est pas un truc d'examen. C'est la tranche. Vous êtes sur une ligne de grille et vous demandez la pente du toit le long de cette ligne.

Le d recourbé est une étiquette d'avertissement

Le symbole ∂, le d recourbé, existe pour que cette tranche ne soit pas confondue avec deux autres dérivées.

Le d ordinaire de dfdx\frac{df}{dx} appartient à une fonction d'une variable. Si quelqu'un écrit dfdx\frac{df}{dx} pour f(x, y), on n'a pas dit ce qui arrive à y. Peut-être que y est indépendant et gelé, c'est alors la partielle. Peut-être que y est secrètement une fonction de x, auquel cas x peut changer la sortie par les deux canaux à la fois, et il faut la dérivée totale. Le d recourbé annonce la première lecture: cette entrée bouge, les autres non.

La notation se scinde ensuite en deux habitudes de même sens:

  • forme de Leibniz: fx\frac{\partial f}{\partial x} et fy\frac{\partial f}{\partial y}
  • forme indicielle: fxf_x et fyf_y

Les deux sont la pente d'une tranche. Les dérivées partielles d'ordre supérieur empilent les indices ou les dénominateurs. fxxf_xx veut dire « trancher en x, puis retrancher cette pente en x », la dérivée seconde ordinaire le long de cette ligne de grille. fxyf_xy veut dire « trancher en x, puis demander comment cette pente en x change quand on marche en y ».

Le d recourbé n'est pas un nouvel algorithme. Règle de puissance, règle du produit, règle de chaîne, tout cela s'applique encore. L'information nouvelle, c'est quelles variables sont gelées. L'oublier, c'est lire tout le sujet comme s'il était nouveau.

Les dérivées croisées mesurent la torsion

Une fois fxf_x en main, on peut dériver encore. Dériver par rapport à x produit fxxf_xx, la concavité de la tranche est-ouest. Dériver par rapport à y produit la dérivée croisée fxyf_xy: comment la pente est-ouest elle-même change quand on marche vers le nord.

Sur le bol x2+y2x^{2} + y^{2}, fxf_x = 2x, donc fxyf_xy = 0. La pente est-ouest ne dépend que de x. Marcher vers le nord ne la change pas. La surface est un bol circulaire, à symétrie de rotation, sans torsion.

Sur la selle

f(x,y)=x2y2f(x, y) = x^{2} - y^{2}

les premières partielles sont fxf_x = 2x et fyf_y = -2y. Les croisées sont encore toutes deux nulles. L'exemple croisé intéressant est un produit,

f(x,y)=x2yf(x, y) = x^{2} y

Ici fxf_x = 2xy, puis fxyf_xy = 2x. De l'autre côté, fyf_y = x2x^{2}, puis fyxf_yx = 2x. Les deux croisées coïncident.

Cet accord est le cas usuel, pas un hasard. Pour les fonctions lisses d'un premier cours de calcul à plusieurs variables, les dérivées croisées sont égales: la torsion que l'on sent en marchant à l'est puis au nord est celle que l'on sent en marchant au nord puis à l'est. Le théorème a des hypothèses techniques (les croisées doivent être continues), pas l'image. Sur une surface sans pli, l'ordre des deux petits pas n'importe pas.

Quand un manuel demande de « vérifier que fxyf_xy = fyxf_yx », il demande de contrôler que la surface n'est pas tordue dans un ordre et pas dans l'autre. Pour toute fonction d'un cours d'introduction, cela se vérifie, et le calcul est de la pratique de la règle de tranche, pas une idée nouvelle.

Le gradient rassemble les pentes

Deux premières partielles en un point sont deux nombres. Écrits en paire, ils deviennent un vecteur dans le plan des entrées:

f=(fx,fy)\nabla f = (f_x, f_y)

Ce vecteur est le gradient. Chaque composante est la pente d'une tranche, donc l'objet entier est un trajet: « autant vers l'est, autant vers le nord » dans les coordonnées du sol, pas dans la hauteur. Le trajet pointe vers la plus forte montée. Sa longueur dit à quel point cette montée est raide. Le trajet opposé, -f\nabla f, pointe vers le bas, c'est pourquoi la descente de gradient marche contre le gradient.

En (1, 2) sur le bol x2+y2x^{2} + y^{2}, le gradient est (2, 4). Depuis ce point du sol, le plus rapide chemin vers le haut du toit est la direction du vecteur (2, 4), la même direction que (1, 2) lui-même. Le chemin le plus raide sur un bol circulaire va radialement vers l'extérieur, ce que l'image suggérait déjà et que le gradient confirme.

Un point où les deux partielles s'annulent est un point critique. Le trajet du gradient a longueur nulle: au premier ordre, aucune direction n'est ni montée ni descente. Cela peut être un minimum (le fond du bol, à l'origine), un maximum (le sommet d'une colline) ou une selle (un col: un minimum le long d'une tranche et un maximum le long de l'autre). La selle x2y2x^{2} - y^{2} a un point critique à l'origine. La tranche en x est une vallée, la tranche en y une crête, et le gradient est nul parce que ces deux pentes du premier ordre s'effondrent en un instant plat plutôt qu'en un voisinage plat.

L'optimisation à plusieurs variables est cette recherche. Trouver où le gradient est le trajet nul, puis lire les dérivées secondes, ou les tranches voisines, pour voir si l'on a un bol, une colline ou un col. Le test de la dérivée seconde avec D = fxxf_xx fyyf_yy - (fxyf_xy)² est une version empaquetée de cette lecture. D n'est pas l'idée. L'idée, c'est que les deux tranches, et la torsion entre elles, classent le point.

La règle de chaîne à plusieurs variables est le même appariement en mouvement. Si un chemin (x(t), y(t)) marche sur le sol, la hauteur le long du chemin change au taux

dfdt=fxx(t)+fyy(t)\frac{df}{dt} = f_x x'(t) + f_y y'(t)

c'est-à-dire le produit scalaire du gradient et de la vitesse du chemin. La surface offre un trajet de pentes. Le chemin offre un trajet de mouvement. Leur accord est le taux auquel la hauteur change pour quelqu'un qui marche vraiment. Quand le chemin est parallèle au gradient, la hauteur change aussi vite que possible. Quand il lui est perpendiculaire, la hauteur est instantanément constante, ce qui est le sens géométrique d'une courbe de niveau.

D'où viennent les erreurs

Les erreurs de dérivées partielles sont presque toutes des échecs à geler la bonne variable.

La première: dériver tout ce qui est en vue. Pour x\frac{\partial}{\partial x} de 3x23x^{2}y, un étudiant écrit 6xy + 3x23x^{2}, la somme des deux partielles, ou 6x, comme si y était x. La règle de tranche est plus stricte: y est un nombre pendant cette dérivée. Il ne reste dans la réponse que comme coefficient.

La deuxième: croire qu'une surface a une seule pente. Un logiciel qui colorie par hauteur peut le cacher, parce que l'œil lit une seule raideur. Demandez la pente en un point et il faut répondre « dans quelle direction? ». Une dérivée partielle est une telle réponse. Le gradient est la collection des réponses alignées sur les axes. Ni l'un ni l'autre n'est « la » pente du toit.

La troisième: confondre ∂ et d. Si y dépend vraiment de x, geler y est le mauvais modèle de la situation. Les taux liés et certaines équations différentielles ont besoin de la dérivée totale, qui laisse chaque canal de dépendance contribuer. Une dérivée partielle est correcte quand les autres entrées sont vraiment indépendantes, ou quand vous avez choisi d'étudier un canal exprès.

La quatrième: traiter un gradient nul comme un minimum garanti. L'origine de x2y2x^{2} - y^{2} est critique et n'est ni un min ni un max. La platitude du premier ordre n'est pas celle du second. Il faut encore regarder les tranches.

La cinquième: lire f\nabla f comme une valeur de f. Le gradient n'est pas la hauteur. C'est un trajet dans le plan des entrées, construit à partir de pentes. Les confondre, c'est le même mélange contre lequel l'article sur les vecteurs mettait en garde: traiter une direction comme un lieu.

Où Math Zen s'insère

Les dérivées partielles reposent sur les dérivées ordinaires comme les matrices reposent sur les vecteurs. Si les règles à une variable sont encore verbales, chaque tranche devient un rituel. Si elles sont fluides, une dérivée partielle est une décision de plus: quelle entrée bouge.

La pratique des dérivées partielles dans Math Zen suit cet ordre. Les premiers seaux forent la tranche elle-même: donnée f(x, y), écrire fxf_x et fyf_y en traitant l'autre variable comme constante. Les seaux suivants empilent les dérivées (fxxf_xx, fxyf_xy, fyxf_yx), assemblent le gradient, appliquent la règle de chaîne le long d'un chemin et classent les points critiques. Les images de cet article sont exactement cette liste.

Une boucle utile: prenez une fonction de deux variables, dessinez les deux tranches en un point, calculez les deux premières partielles, formez le gradient et dites à voix haute de quel côté ça monte. Revenez ensuite après une pause, selon le même calendrier de répétition espacée que le reste de la séquence d'analyse. Le but n'est pas de mémoriser que « y est constant ». C'est de voir une surface et de savoir quelle promenade vous faites.

En bref

Une dérivée partielle est la pente d'une surface dans une direction, toutes les autres entrées tenues immobiles. Le d recourbé marque ce gel. Les dérivées croisées demandent comment la pente d'une tranche change quand on marche le long de l'autre axe, et sur une surface lisse les deux ordres s'accordent. Le gradient rassemble les premières partielles en un trajet qui pointe vers le haut. Les points critiques sont les endroits où ce trajet s'évanouit, et ils peuvent être des bols, des collines ou des selles.

Tenue ainsi, la dérivation à plusieurs variables n'est pas une nouvelle sorte de calcul. C'est le calcul ordinaire, visé le long d'une ligne de grille à la fois, puis réassemblé. La surface a beaucoup de pentes. Une dérivée partielle est ce que l'on obtient quand on dit enfin laquelle on vise.

Questions fréquentes

Qu'est-ce qu'une dérivée partielle, simplement ?
Une dérivée partielle est la pente d'une surface dans une direction, toutes les autres entrées tenues immobiles. Pour une fonction f(x, y), la dérivée partielle par rapport à x demande comment la sortie change quand on ne bouge qu'en x, y étant fixé. C'est la dérivée ordinaire de cette tranche à une variable. La surface elle-même n'a pas une seule pente; elle a une pente pour chaque direction de marche.
Que signifie le d recourbé (∂) ?
Le symbole ∂, souvent lu « del » ou « partiel », marque une dérivée dans laquelle certaines entrées sont tenues constantes. Pour f(x, y), ∂f/∂x est le taux de variation en x avec y gelé, et ∂f/∂y le taux en y avec x gelé. Le d recourbé n'est pas une nouvelle opération. C'est une étiquette d'avertissement: voici une tranche d'une fonction de plusieurs variables, pas la dérivée d'une fonction d'une variable, et pas la variation totale quand toutes les entrées bougent à la fois.
Comment calcule-t-on une dérivée partielle ?
Traitez comme constante chaque variable par rapport à laquelle vous ne dérivez pas, puis appliquez les règles ordinaires. Pour f(x, y) = x² + y², ∂f/∂x = 2x car y² ne dépend pas de x, et ∂f/∂y = 2y car x² ne dépend pas de y. Pour f(x, y) = 3x²y, ∂f/∂x = 6xy et ∂f/∂y = 3x². Si un terme contient les deux variables, gardez l'autre comme coefficient fixe pendant la dérivation.
Quelle est la différence entre dérivée partielle et dérivée ordinaire ?
Une dérivée ordinaire est la pente d'une courbe: une fonction d'une entrée. Une dérivée partielle est la pente d'une surface le long d'un axe: une fonction de deux entrées ou plus, vue à travers une seule tranche. Les règles de calcul sont les mêmes. La différence est l'image. Si y n'est pas une entrée indépendante mais une fonction de x, il faut la dérivée totale, qui compte tous les chemins par lesquels x change la sortie, et non une partielle qui fige y.
Qu'est-ce qu'un gradient, en langage simple ?
Le gradient de f est la liste de ses dérivées partielles premières, écrite comme un vecteur. Pour f(x, y), ce vecteur est (∂f/∂x, ∂f/∂y). Chaque composante est la pente dans une direction de coordonnée, donc le vecteur entier est un trajet dans le plan des entrées. Il pointe vers la plus forte montée, et sa longueur dit à quel point cette montée est raide. Annuler le gradient trouve les points où aucune direction du premier ordre n'est ni montée ni descente: minima, maxima ou cols.

Passer à la pratique