Lernen aus Feedback
Reinforcement Learning einfach erklärt
Reinforcement Learning beschreibt, wie ein System durch Handeln und Rückmeldung lernt, Entscheidungen über viele Schritte hinweg gut zu treffen. Die Grundbegriffe, die Bellman-Gleichung und Q-Learning – mit einem kleinen Beispiel zum Nachrechnen.
Auf einen Blick
- Reinforcement Learning lernt aus Belohnungen statt aus richtigen Antworten: Ein Agent handelt, beobachtet die Folgen und verbessert schrittweise seine Strategie.
- Die Bellman-Gleichung zerlegt den Wert einer Entscheidung in die sofortige Belohnung und den abgezinsten Wert des Folgezustands. Darauf bauen Value Iteration und Q-Learning auf.
- In der Praxis entscheiden Belohnungsdesign, Datenmenge, Güte der Simulation und Sicherheitsgrenzen über den Erfolg – nicht allein der Algorithmus.
Viele Entscheidungen wirken über den Moment hinaus. Wer heute Lagerbestand aufbaut, hat morgen weniger Kapital; ein Zug im Schach verändert alle folgenden Möglichkeiten. Reinforcement Learning, auf Deutsch auch bestärkendes Lernen, ist das Teilgebiet des maschinellen Lernens, das genau solche Folgen von Entscheidungen behandelt: Ein Agent lernt aus Rückmeldungen, wie er handeln sollte, damit die Summe der Belohnungen auf lange Sicht möglichst groß wird (Sutton & Barto 2018).
Lernen durch Handeln
Beim überwachten Lernen liegt zu jedem Beispiel die richtige Antwort bereit. Beim Reinforcement Learning gibt es sie nicht. Der Agent erfährt nur, wie gut oder schlecht die Folgen seiner Handlungen waren – und oft erst viele Schritte später. Daraus ergeben sich zwei Aufgaben, die überwachte Verfahren nicht kennen: Er muss herausfinden, welche früheren Handlungen eine späte Belohnung verdient haben, und er muss auch Handlungen ausprobieren, deren Folgen er noch nicht kennt.
Formal ist das ein Regelkreis. Zu jedem Zeitpunkt beobachtet der Agent einen Zustand , wählt eine Aktion und erhält von der Umgebung eine Belohnung sowie den nächsten Zustand .
Das Modell: der Markov-Entscheidungsprozess
Der mathematische Rahmen ist der Markov-Entscheidungsprozess (englisch Markov Decision Process, MDP) (Puterman 1994). Er besteht aus
- einer Menge von Zuständen und einer Menge von Aktionen ,
- Übergangswahrscheinlichkeiten : Mit welcher Wahrscheinlichkeit führt Aktion im Zustand in den Zustand ?
- einer Belohnungsfunktion und
- einem Diskontfaktor zwischen 0 und 1.
„Markov“ heißt: Der aktuelle Zustand enthält alles, was für die Zukunft zählt. Die Vorgeschichte spielt keine zusätzliche Rolle.
Das Ziel des Agenten ist nicht die nächste Belohnung, sondern der Return, die abgezinste Summe aller künftigen Belohnungen:
Ein nahe 0 macht den Agenten kurzsichtig, ein nahe 1 weitsichtig. Wie ein Zinssatz drückt aus, dass eine Belohnung heute mehr wert ist als dieselbe Belohnung später. Grob gilt: Belohnungen, die deutlich weiter als Schritte entfernt sind, fallen kaum noch ins Gewicht – bei sind das etwa zehn Schritte.
Wie sich der Agent verhält, beschreibt seine Strategie, die Policy : die Wahrscheinlichkeit, im Zustand die Aktion zu wählen. Gesucht ist eine Policy, die den erwarteten Return maximiert.
Werte und die Bellman-Gleichung
Zwei Wertfunktionen machen diese Suche handhabbar. Der Zustandswert ist der erwartete Return, wenn man in startet und danach der Policy folgt. Der Aktionswert ist der erwartete Return, wenn man in zuerst die Aktion wählt und danach folgt.
Richard Bellman hat gezeigt, dass sich solche Werte rekursiv schreiben lassen (Bellman 1957). Für eine feste Policy gilt die Bellman-Erwartungsgleichung:
In Worten: Der Wert eines Zustands ist die erwartete sofortige Belohnung plus der abgezinste Wert dessen, was danach kommt. Für die bestmögliche Policy wird aus der Mittelung über Aktionen ein Maximum – die Bellman-Optimalitätsgleichung:
Kennt man die optimalen Werte, ist die optimale Policy einfach: In jedem Zustand wählt man die Aktion, die das Maximum erreicht. Dieselbe Gleichung gibt es für Aktionswerte, . Sie ist die Grundlage für Q-Learning.
Ein Beispiel zum Nachrechnen: der Korridor
Ein Agent steht in einem Korridor aus drei Feldern A, B und C. Rechts von C liegt das Ziel, das die Episode beendet. In jedem Feld kann er nach links oder rechts gehen; von A aus nach links bleibt er stehen. Wer das Ziel erreicht, erhält eine Belohnung von 10, jeder andere Schritt bringt 0. Der Diskontfaktor ist .
Value Iteration löst die Bellman-Optimalitätsgleichung, indem sie sie wiederholt als Rechenvorschrift anwendet. Man startet mit für alle Felder und berechnet in jedem Durchlauf für jedes Feld neu:
| Durchlauf | |||
|---|---|---|---|
| 0 | 0 | 0 | 0 |
| 1 | 0 | 0 | 10 |
| 2 | 0 | 9 | 10 |
| 3 | 8,1 | 9 | 10 |
| 4 | 8,1 | 9 | 10 |
Im ersten Durchlauf erkennt nur C, dass ein Schritt nach rechts 10 einbringt. Im zweiten erfährt B davon: Rechts wartet C mit Wert 10, abgezinst also . Im dritten erreicht die Information A mit . Danach ändert sich nichts mehr – die Werte sind konvergiert. Sie fließen vom Ziel rückwärts durch den Zustandsraum, und ist genau die Belohnung 10, zweimal um den Faktor 0,9 abgezinst. Die optimale Policy liest man direkt ab: überall nach rechts.
Eine verwandte Methode ist die Policy Iteration: Sie berechnet abwechselnd die Werte einer festen Policy und verbessert die Policy dann, indem sie in jedem Zustand die beste Aktion bezüglich dieser Werte wählt. Beide Verfahren gehören zur dynamischen Programmierung und setzen voraus, dass man Übergänge und Belohnungen kennt (Puterman 1994).
Gridworld: Reinforcement Learning zum Anfassen
Der interaktive Explainer zeigt Value Iteration und Q-Learning in einer größeren Welt mit Ziel, Fallen und Wänden. Ohne JavaScript bleibt das Korridor-Beispiel oben die vollständige Rechnung.
Lernen ohne Modell: TD-Lernen und Q-Learning
In den meisten interessanten Anwendungen kennt man und nicht. Der Agent muss aus Erfahrung lernen: aus beobachteten Übergängen der Form (Zustand, Aktion, Belohnung, Folgezustand). Das Temporal-Difference-Lernen schätzt Werte, indem es jede Schätzung ein Stück in Richtung eines Ziels verschiebt, das selbst eine Schätzung enthält – die beobachtete Belohnung plus den geschätzten Wert des Folgezustands (Sutton 1988).
Q-Learning wendet diese Idee auf Aktionswerte an (Watkins & Dayan 1992). Nach jedem Schritt wird der Wert der gewählten Aktion aktualisiert:
Der Ausdruck in der Klammer heißt TD-Fehler: der Unterschied zwischen dem, was die Erfahrung nahelegt, und der bisherigen Schätzung. Die Lernrate bestimmt, wie weit man ihm folgt.
Q-Learning hat eine bemerkenswerte Eigenschaft: Es lernt die Werte der besten Policy, auch während der Agent sich anders verhält, etwa weil er noch ausprobiert. Man nennt das Off-Policy-Lernen. Im tabellarischen Fall konvergieren die Schätzungen gegen , wenn jedes Zustand-Aktion-Paar unbegrenzt oft besucht wird und die Lernrate passend kleiner wird (Watkins & Dayan 1992).
Damit wird auch klar, warum Erkunden notwendig ist. Ein Agent, der immer nur die bisher beste Aktion wählt, erfährt nie, ob eine andere besser gewesen wäre. Die einfachste Lösung ist ε-greedy: meistens die beste bekannte Aktion wählen, mit kleiner Wahrscheinlichkeit eine zufällige. Dasselbe Dilemma zwischen Erkunden und Ausnutzen behandeln – ohne Zustände und mit eleganteren Lösungen – die Multi-Armed Bandits.
Von Tabellen zu neuronalen Netzen
Tabellen funktionieren nur, solange man alle Zustände aufzählen kann. Schon ein Bild mit wenigen Pixeln hat mehr mögliche Zustände, als je besucht werden können. Dann ersetzt man die Tabelle durch eine Funktion, die Werte aus Merkmalen des Zustands berechnet – linear oder mit einem neuronalen Netz. Die Kombination mit tiefen Netzen heißt Deep Reinforcement Learning. Einen Meilenstein setzte das Deep-Q-Network, das 49 Atari-Spiele direkt aus Bildschirmpixeln erlernte und dafür unter anderem frühere Erfahrungen zwischenspeicherte und erneut verwendete (Mnih et al. 2015).
Ein zweiter großer Zweig optimiert die Policy direkt. Policy-Gradient-Verfahren verändern die Parameter einer Policy in die Richtung, in der der erwartete Return steigt; der klassische Ausgangspunkt ist der REINFORCE-Algorithmus (Williams 1992). Actor-Critic-Methoden verbinden beide Welten: Ein Teil lernt die Policy, ein anderer ihre Werte.
In Brettspielen zeigt sich, wie gut Lernen und Planen zusammenpassen. AlphaZero kombinierte ein durch Selbstspiel trainiertes Netz mit einer Baumsuche, die in jeder Stellung vorausrechnet, und erreichte so in Schach, Shogi und Go sehr hohe Spielstärke (Silver et al. 2018). Die Suche nutzt dabei ein Modell der Spielregeln – ein Luxus, den reale Anwendungen selten haben.
Welches Verfahren passt zu welcher Frage?
Reinforcement Learning ist mächtig, aber nicht immer die beste Wahl. Oft löst ein einfacheres Verfahren dieselbe Aufgabe mit weniger Daten und besser nachvollziehbar:
| Situation | Naheliegender Ansatz |
|---|---|
| Einmalige Entscheidung, Wahrscheinlichkeiten und Folgen abschätzbar | Entscheidungstheorie mit Erwartungsnutzen |
| Wiederholte Wahl zwischen Optionen, keine Folgezustände | Multi-Armed Bandit |
| Modell bekannt, viele Nebenbedingungen, Planung über einen Horizont | Optimierung oder dynamische Programmierung |
| Folgen über viele Schritte, Modell unbekannt, Erfahrung oder Simulation verfügbar | Reinforcement Learning |
Reinforcement Learning in der Praxis
Zwischen Lehrbuchbeispiel und produktivem Einsatz liegen einige typische Hürden:
- Belohnungsdesign. Ein Agent optimiert genau das, was man belohnt – nicht das, was man meint. Ist die Belohnung unvollständig spezifiziert, findet er Abkürzungen, die formal Punkte bringen, aber das eigentliche Ziel verfehlen. Diese Gefahr heißt Reward Hacking und ist eines der bekannten Sicherheitsprobleme lernender Systeme (Amodei et al. 2016).
- Datenhunger. Viele Verfahren brauchen Millionen von Interaktionen. Deshalb lernen Agenten häufig in Simulationen – und müssen dann die Lücke zwischen Simulation und Wirklichkeit überbrücken.
- Lernen aus vorhandenen Daten. Offline Reinforcement Learning lernt aus protokollierten Entscheidungen, ohne selbst auszuprobieren. Das ist sicherer, aber schwierig, weil die Daten nur die Handlungen enthalten, die tatsächlich gewählt wurden (Levine et al. 2020).
- Grenzen und Aufsicht. In realen Prozessen gelten harte Nebenbedingungen, und Fehlentscheidungen kosten echtes Geld oder mehr. Sinnvoll sind feste Leitplanken, schrittweise Freigaben, laufende Überwachung und die Möglichkeit, Entscheidungen zurückzunehmen.
Fazit
Reinforcement Learning beruht auf einer einfachen Struktur: Zustände, Aktionen, Belohnungen und die Bellman-Gleichung, die den Wert einer Entscheidung mit dem Wert ihrer Folgen verknüpft. Value Iteration nutzt sie, wenn das Modell bekannt ist; Q-Learning lernt dieselben Werte aus Erfahrung. Der Weg in die Praxis führt über sorgfältig gestaltete Belohnungen, realistische Simulationen und klare Grenzen. Wer tiefer einsteigen will, findet bei Sutton und Barto die vollständige Darstellung (Sutton & Barto 2018).
Häufige Fragen
Was ist der Unterschied zwischen Reinforcement Learning und überwachtem Lernen?
Beim überwachten Lernen gibt es zu jedem Beispiel die richtige Antwort. Beim Reinforcement Learning erhält der Agent nur eine Belohnung für die Folgen seiner Handlungen, oft erst viele Schritte später. Er muss selbst herausfinden, welche Handlungen dazu beigetragen haben, und dabei auch Unbekanntes ausprobieren.
Was ist Q-Learning?
Q-Learning ist ein Verfahren, das für jede Kombination aus Zustand und Aktion schätzt, wie viel abgezinste Belohnung langfristig zu erwarten ist. Nach jedem Schritt wird die Schätzung ein Stück in Richtung von sofortiger Belohnung plus bestem geschätzten Folgewert verschoben. Ein Modell der Umgebung braucht es dafür nicht.
Was sagt die Bellman-Gleichung?
Sie besagt, dass der Wert eines Zustands gleich der erwarteten sofortigen Belohnung plus dem abgezinsten Wert des Folgezustands ist. Für die optimale Strategie wählt man dabei in jedem Zustand die Aktion mit dem höchsten Wert. Aus dieser rekursiven Beziehung leiten sich fast alle Verfahren des Reinforcement Learning ab.
Braucht Reinforcement Learning neuronale Netze?
Nein. Kleine Probleme lassen sich mit Tabellen lösen, in denen jeder Zustand oder jedes Zustand-Aktion-Paar einen eigenen Wert hat. Neuronale Netze oder andere Funktionsapproximationen braucht man erst, wenn es zu viele Zustände für eine Tabelle gibt – etwa bei Bildern als Eingabe.
Quellen und weiterführende Literatur
- BuchSutton, R. S. und Barto, A. G. (2018): Reinforcement Learning: An Introduction (2. Auflage). MIT Press.Das Standardlehrbuch; die Autoren stellen eine PDF-Fassung frei zur Verfügung.
- BuchBellman, R. (1957): Dynamic Programming. Princeton University Press.
- BuchPuterman, M. L. (1994): Markov Decision Processes: Discrete Stochastic Dynamic Programming. Wiley.
- PaperSutton, R. S. (1988): Learning to predict by the methods of temporal differences. Machine Learning 3(1), 9–44.
- PaperWatkins, C. J. C. H. und Dayan, P. (1992): Q-learning. Machine Learning 8(3–4), 279–292.
- PaperWilliams, R. J. (1992): Simple statistical gradient-following algorithms for connectionist reinforcement learning. Machine Learning 8(3–4), 229–256.
- PaperMnih, V., Kavukcuoglu, K., Silver, D. et al. (2015): Human-level control through deep reinforcement learning. Nature 518(7540), 529–533.
- PaperSilver, D., Hubert, T., Schrittwieser, J. et al. (2018): A general reinforcement learning algorithm that masters chess, shogi, and Go through self-play. Science 362(6419), 1140–1144.
- PaperAmodei, D., Olah, C., Steinhardt, J., Christiano, P., Schulman, J. und Mané, D. (2016): Concrete Problems in AI Safety. arXiv:1606.06565.
- PaperLevine, S., Kumar, A., Tucker, G. und Fu, J. (2020): Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems. arXiv:2005.01643.
Zuletzt fachlich geprüft am 25. September 2026. Hinweise auf Fehler nehmen wir gern entgegen: impressum@nyxai.com.