Partielle Ableitungen intuitiv verstehen (Steigung in eine Richtung)

Eine gewöhnliche Ableitung ist die Steigung einer Kurve. Du hast einen Eingang, einen Ausgang, und an jedem Punkt eine einzige Zahl, die sagt, wie schnell sich der Ausgang ändert. Dieses Bild bricht zusammen, sobald die Funktion zwei Eingänge hat. Ein Graph in drei Dimensionen ist eine Fläche, keine Kurve, und eine Fläche hat keine einzige Steigung. Vom selben Punkt aus kannst du nach Osten gehen und einen sanften Anstieg finden, oder nach Norden und einen Abstieg.
Die partielle Ableitung ist der ehrliche Ersatz. Sie beantwortet eine engere Frage: Wenn ich alle anderen Eingaben stillhalte und nur in diese Richtung gehe, wie steil ist es? Der Rest des Kapitels, gemischte Partielle, der Gradient, die mehrdimensionale Kettenregel, ist dieselbe Frage entlang mehrerer Wege.
Eine Fläche hat keine einzige Steigung
Eine Funktion einer Variablen zeichnet eine Kurve in der Ebene. Eine Funktion zweier Variablen, f(x, y), zeichnet eine Fläche im Raum. Jedes Paar (x, y) ist ein Punkt auf dem Boden, und f(x, y) ist die Höhe des Dachs über diesem Punkt.
Nimm die Schüssel
Am Ursprung ist die Höhe 0. Bei (1, 0) ist sie 1. Bei (0, 2) ist sie 4. Bei (1, 2) ist sie 5. Wenn du bei (1, 2) stehst, verdient keine einzelne Zahl den Namen "die Steigung". Geh in x-Richtung, und das Dach steigt weiter. Geh in y-Richtung, und es steigt schneller. Geh diagonal, und du bekommst eine Mischung aus beiden.
Deshalb fühlen sich Studierende, die die eindimensionale Analysis beherrschen, den Boden unter den Füßen weichen. Die Ableitung, der sie vertrauten, war eine vollständige Beschreibung der lokalen Änderung. Auf einer Fläche ist sie nur die Beschreibung eines gewählten Spaziergangs.
Wetterkarten und topografische Karten nutzen die Idee schon. Eine Höhenlinie ist eine Menge von Punkten gleicher Höhe. Wo die Linien dicht liegen, ist die Fläche steil. Wo sie sich spreizen, ist sie flach. Eine partielle Ableitung ist die Steigung, die du messen würdest, wenn du einer Gitterlinie auf dieser Karte folgst und die andere ignorierst.
Halte einen Eingang still
Der Zug, der die Fläche lesbar macht, ist ein Schnitt.
Halte y fest, etwa y = 2, und schau nur, wie die Höhe von x abhängt. Die Funktion schrumpft auf
eine gewöhnliche Parabel, die vier Einheiten über der x-Achse sitzt. Ihre Ableitung ist 2x. Diese Zahl ist die partielle Ableitung von f nach x, ausgewertet entlang der Geraden y = 2. Bei x = 1 ist sie 2: stehst du bei (1, 2) und machst einen winzigen Schritt in x-Richtung, steigt das Dach etwa 2 Höheneinheiten pro Schrittweite.
Halte stattdessen x fest, etwa x = 1, und der Schnitt ist
mit Ableitung 2y. Bei y = 2 ist diese Steigung 4. Derselbe Punkt, anderer Spaziergang, andere Steigung. Das ist kein Widerspruch. Du hast zwei verschiedene Fragen gestellt.
Rechnerisch gilt die Regel der eindimensionalen Analysis. Um zu finden, behandle y als Konstante und leite nach x ab. Um zu finden, behandle x als Konstante und leite nach y ab. Für die Schüssel gilt = 2x und = 2y. Die andere Variable taucht gar nicht auf, weil jedes Glied in nur von einem Eingang abhängt. In einem Produkt wie y stehen beide: ergibt 6xy, weil 3y ein fester Koeffizient von ist, und ergibt , weil ein fester Koeffizient von y ist.
Der Satz "halte die andere Variable konstant" ist kein Prüfungstrick. Er ist der Schnitt. Du stehst auf einer Gitterlinie und fragst nach der Steigung des Dachs entlang dieser Linie.
Das geschwungene d ist ein Warnschild
Das Symbol ∂, das geschwungene d, existiert, damit dieser Schnitt nicht mit zwei anderen Ableitungen verwechselt wird.
Das gewöhnliche d in gehört zu einer Funktion einer Variablen. Schreibt jemand für f(x, y), ist nicht gesagt, was mit y geschieht. Vielleicht ist y unabhängig und eingefroren, dann ist es die Partielle. Vielleicht ist y heimlich eine Funktion von x, dann kann x den Ausgang über beide Kanäle gleichzeitig ändern, und du brauchst die totale Ableitung. Das geschwungene d kündigt die erste Lesart an: dieser Eingang bewegt sich, die anderen nicht.
Die Notation spaltet sich dann in zwei Gewohnheiten mit derselben Bedeutung:
- Leibniz-Form: und
- Indexform: und
Beide sind die Steigung eines Schnitts. Höhere Partielle stapeln die Indizes oder Nenner. heißt "Schnitt in x, dann diesen Anstieg noch einmal in x schneiden", die gewöhnliche zweite Ableitung entlang dieser Gitterlinie. heißt "Schnitt in x, dann fragen, wie sich dieser x-Anstieg ändert, wenn du in y gehst."
Das geschwungene d ist kein neuer Algorithmus. Potenzregel, Produktregel, Kettenregel gelten weiter. Die neue Information ist, welche Variablen eingefroren sind. Das zu vergessen heißt, das ganze Thema als neues Thema zu lesen.
Gemischte Partielle messen die Verdrehung
Hast du , kannst du erneut ableiten. Ableiten nach x liefert , die Krümmung des Ost-West-Schnitts. Ableiten nach y liefert die gemischte Partielle : wie sich die Ost-West-Steigung selbst ändert, wenn du nach Norden gehst.
Auf der Schüssel gilt = 2x, also = 0. Die Ost-West-Steigung hängt nur von x ab. Nach Norden gehen ändert sie nicht. Die Fläche ist eine kreisförmige Schüssel, drehsymmetrisch, ohne Verdrehung.
Auf dem Sattel
sind die ersten Partiellen = 2x und = -2y. Die gemischten sind wieder beide null. Das interessante gemischte Beispiel ist ein Produkt,
Hier ist = 2xy, dann = 2x. Von der anderen Seite ist = , dann = 2x. Die beiden gemischten stimmen überein.
Diese Übereinstimmung ist der Normalfall, kein Zufall. Für die glatten Funktionen eines ersten Kurses in mehrdimensionaler Analysis sind die gemischten Partiellen gleich: die Verdrehung, die du spürst, wenn du erst nach Osten und dann nach Norden gehst, ist dieselbe, die du spürst, wenn du erst nach Norden und dann nach Osten gehst. Der Satz hat technische Voraussetzungen (die gemischten müssen stetig sein), das Bild nicht. Auf einer Fläche ohne Knick spielt die Reihenfolge der zwei kleinen Schritte keine Rolle.
Wenn ein Lehrbuch verlangt, "zeige, dass = ", sollst du prüfen, dass die Fläche nicht in einer Reihenfolge verdreht ist und in der anderen nicht. Für jede Funktion eines Einführungskurses geht das auf, und die Rechnung ist Übung der Schnittregel, keine neue Idee.
Der Gradient sammelt die Steigungen
Zwei erste Partielle an einem Punkt sind zwei Zahlen. Als Paar geschrieben werden sie ein Vektor in der Eingabeebene:
Dieser Vektor ist der Gradient. Jede Komponente ist die Steigung eines Schnitts, also ist das ganze Objekt ein Weg: "so weit nach Osten, so weit nach Norden" in den Bodenkoordinaten, nicht in der Höhe. Der Weg zeigt in die Richtung des steilsten Anstiegs. Seine Länge ist, wie steil dieser Anstieg ist. Der entgegengesetzte Weg, -, zeigt bergab, weshalb Gradientenabstieg gegen den Gradienten läuft.
Bei (1, 2) auf der Schüssel ist der Gradient (2, 4). Von diesem Bodenpunkt aus ist der schnellste Weg das Dach hinauf die Richtung des Vektors (2, 4), dieselbe Richtung wie (1, 2) selbst. Der steilste Pfad auf einer kreisförmigen Schüssel führt radial nach außen, was das Bild schon nahelegte und der Gradient bestätigt.
Ein Punkt, an dem beide Partielle verschwinden, ist ein kritischer Punkt. Der Gradientenweg hat Länge null: in erster Ordnung führt keine Richtung bergauf oder bergab. Das kann ein Minimum sein (der Boden der Schüssel, am Ursprung), ein Maximum (die Kuppe eines Hügels) oder ein Sattel (ein Gebirgspass: Minimum entlang eines Schnitts und Maximum entlang eines anderen). Der Sattel hat einen kritischen Punkt am Ursprung. Der x-Schnitt ist ein Tal, der y-Schnitt ein Grat, und der Gradient ist null, weil diese beiden Steigungen erster Ordnung in einem flachen Augenblick zusammenfallen, nicht in einer flachen Umgebung.
Optimierung in mehreren Variablen ist diese Suche. Finde, wo der Gradient der Nullweg ist, lies dann die zweiten Partiellen oder die benachbarten Schnitte, um zu sehen, ob du eine Schüssel, einen Hügel oder einen Pass vor dir hast. Der Test der zweiten Ableitung mit D = - ()² ist eine verpackte Fassung dieses Lesens. D selbst ist nicht die Idee. Die Idee ist, dass die zwei Schnitte und die Verdrehung dazwischen den Punkt klassifizieren.
Die mehrdimensionale Kettenregel ist dieselbe Paarung in Bewegung. Wenn ein Pfad (x(t), y(t)) über den Boden läuft, ändert sich die Höhe entlang des Pfads mit der Rate
also dem Skalarprodukt des Gradienten mit der Geschwindigkeit des Pfads. Die Fläche bietet einen Weg aus Steigungen. Der Pfad bietet einen Weg aus Bewegung. Ihre Übereinstimmung ist die Rate, mit der sich die Höhe für jemanden ändert, der wirklich geht. Läuft der Pfad parallel zum Gradienten, ändert sich die Höhe so schnell wie möglich. Steht er senkrecht dazu, ist die Höhe augenblicklich konstant, und das ist die geometrische Bedeutung einer Höhenlinie.
Wo die Fehler herkommen
Fehler bei partiellen Ableitungen sind fast immer das Versagen, die richtige Variable einzufrieren.
Der erste: alles differenzieren, was in Sicht ist. Nach von y schreibt jemand 6xy + , die Summe beider Partiellen, oder 6x, als wäre y gleich x. Die Schnittregel ist strenger: y ist während dieser Ableitung eine Zahl. Im Ergebnis bleibt sie nur als Koeffizient.
Der zweite: glauben, eine Fläche habe eine Steigung. Software, die nach Höhe einfärbt, kann das verbergen, weil das Auge eine einzige Steilheit liest. Fragst du nach der Steigung an einem Punkt, musst du antworten "in welche Richtung?" Eine partielle Ableitung ist eine solche Antwort. Der Gradient ist die Sammlung der achsenparallelen Antworten. Keines von beiden ist "die" Steigung des Dachs.
Der dritte: ∂ mit d zu verwechseln. Hängt y wirklich von x ab, ist das Einfrieren von y das falsche Modell der Lage. Verwandte Raten und manche Differentialgleichungen brauchen die totale Ableitung, die jedem Abhängigkeitskanal einen Beitrag lässt. Eine partielle Ableitung ist richtig, wenn die anderen Eingaben wirklich unabhängig sind, oder wenn du absichtlich einen Kanal untersuchst.
Der vierte: einen Nullgradienten für ein garantiertes Minimum zu halten. Der Ursprung von ist kritisch und weder Min noch Max. Flachheit erster Ordnung ist nicht Flachheit zweiter Ordnung. Du musst dir die Schnitte trotzdem ansehen.
Der fünfte: als Wert von f zu lesen. Der Gradient ist nicht die Höhe. Er ist ein Weg in der Eingabeebene, gebaut aus Steigungen. Die beiden zu verwechseln ist dieselbe Verwechslung, vor der der Vektorartikel warnt: eine Richtung für einen Ort zu halten.
Wo Math Zen hingehört
Partielle Ableitungen sitzen auf gewöhnlichen Ableitungen wie Matrizen auf Vektoren. Sind die eindimensionalen Regeln noch verbal, wird jeder Schnitt ein Ritual. Sind sie flüssig, ist eine partielle Ableitung eine Extraentscheidung: welcher Eingang sich bewegt.
Die Übung zu partiellen Ableitungen in Math Zen folgt dieser Ordnung. Frühe Körbe bohren den Schnitt selbst: gegeben f(x, y), schreibe und , indem du die andere Variable als Konstante behandelst. Spätere Körbe stapeln Ableitungen (, , ), bauen den Gradienten, wenden die Kettenregel entlang eines Pfads an und klassifizieren kritische Punkte. Die Bilder in diesem Artikel sind genau diese Liste.
Eine nützliche Schleife: nimm eine Funktion zweier Variablen, zeichne die zwei Schnitte an einem Punkt, berechne beide ersten Partiellen, bilde den Gradienten und sag laut, wohin es bergauf geht. Komm dann nach einer Pause zurück, mit demselben Spaced-Repetition-Plan wie im Rest der Analysis-Folge. Das Ziel ist nicht, auswendig zu lernen, dass "y konstant ist". Das Ziel ist, eine Fläche zu sehen und zu wissen, welchen Spaziergang du machst.
Die Kurzfassung
Eine partielle Ableitung ist die Steigung einer Fläche in eine Richtung, während jeder andere Eingang stillgehalten wird. Das geschwungene d markiert dieses Einfrieren. Gemischte Partielle fragen, wie sich die Steigung eines Schnitts ändert, wenn du entlang der anderen Achse gehst, und auf einer glatten Fläche stimmen die zwei Reihenfolgen überein. Der Gradient sammelt die ersten Partiellen zu einem Weg, der bergauf zeigt. Kritische Punkte sind die Stellen, an denen dieser Weg verschwindet, und sie können Schüsseln, Hügel oder Sattel sein.
So zusammengehalten ist mehrdimensionales Differenzieren keine neue Art von Analysis. Es ist gewöhnliche Analysis, jeweils entlang einer Gitterlinie gezielt, dann wieder zusammengesetzt. Die Fläche hat viele Steigungen. Eine partielle Ableitung ist, was du bekommst, wenn du endlich sagst, welche du meinst.
Häufige Fragen
- Was ist eine partielle Ableitung einfach erklärt?
- Eine partielle Ableitung ist die Steigung einer Fläche in eine Richtung, während jeder andere Eingang stillgehalten wird. Für eine Funktion f(x, y) fragt die partielle Ableitung nach x, wie sich der Ausgang ändert, wenn du nur in x gehst und y festhältst. Das ist die gewöhnliche Ableitung dieses eindimensionalen Schnitts. Die Fläche selbst hat keine einzige Steigung; sie hat für jede Laufrichtung eine eigene.
- Was bedeutet das geschwungene d (∂)?
- Das Symbol ∂, oft als 'del' oder 'partiell' gelesen, kennzeichnet eine Ableitung, bei der einige Eingaben konstant gehalten werden. Für f(x, y) ist ∂f/∂x die Änderungsrate in x bei eingefrorenem y, und ∂f/∂y die Änderungsrate in y bei eingefrorenem x. Das geschwungene d ist keine neue Operation. Es ist ein Warnschild: Dies ist der Schnitt einer Funktion mehrerer Variablen, nicht die Ableitung einer Funktion einer Variablen und nicht die totale Änderung, wenn sich alle Eingaben gleichzeitig bewegen.
- Wie berechnet man eine partielle Ableitung?
- Behandle jede Variable, nach der du nicht ableitest, als Konstante und nutze die gewöhnlichen Ableitungsregeln. Für f(x, y) = x² + y² gilt ∂f/∂x = 2x, weil y² nicht von x abhängt, und ∂f/∂y = 2y, weil x² nicht von y abhängt. Für f(x, y) = 3x²y gilt ∂f/∂x = 6xy und ∂f/∂y = 3x². Stehen beide Variablen in einem Term, bleibt die andere ein fester Koeffizient.
- Was ist der Unterschied zwischen partieller und gewöhnlicher Ableitung?
- Eine gewöhnliche Ableitung ist die Steigung einer Kurve: einer Funktion mit einem Eingang. Eine partielle Ableitung ist die Steigung einer Fläche entlang einer Achse: einer Funktion mit zwei oder mehr Eingängen, betrachtet durch einen einzigen Schnitt. Beide nutzen dieselben Rechenregeln. Der Unterschied ist das Bild. Wenn y kein unabhängiger Eingang ist, sondern selbst eine Funktion von x, brauchst du die totale Ableitung, die jeden Weg berücksichtigt, auf dem x den Ausgang ändert, nicht eine partielle, die y einfriert.
- Was ist ein Gradient in einfachen Worten?
- Der Gradient von f ist die Liste ihrer ersten partiellen Ableitungen, als Vektor geschrieben. Für f(x, y) ist das (∂f/∂x, ∂f/∂y). Jede Komponente ist die Steigung in eine Koordinatenrichtung, also ist der ganze Vektor ein Weg in der Eingabeebene. Er zeigt in die Richtung des steilsten Anstiegs, und seine Länge sagt, wie steil dieser Anstieg ist. Den Gradient auf null setzen findet die Punkte, an denen keine Richtung erster Ordnung bergauf oder bergab führt: Minima, Maxima oder Sattelpunkte.


