Interaktiver Explainer
Gridworld: Reinforcement Learning zum Anfassen
Eine kleine Welt mit Ziel, Fallen und Wänden: Sehen Sie zu, wie Value Iteration die Werte vom Ziel rückwärts berechnet – und wie ein Q-Learning-Agent dieselbe Welt durch Versuch und Irrtum kennenlernt.
Gridworld: Reinforcement Learning zum Anfassen
Dieser Explainer benötigt JavaScript. Die Idee dahinter: Jedes Feld der Welt ist ein Zustand, der Agent kann nach oben, rechts, unten oder links gehen, und die Bellman-Gleichung verknüpft den Wert eines Feldes mit den Werten seiner Nachbarn.
So funktioniert der Explainer
Die Welt ist ein Markov-Entscheidungsprozess mit 6 × 5 Feldern. In jedem Feld wählt der Agent eine von vier Richtungen. Läuft er gegen eine Wand oder den Rand, bleibt er stehen. Jeder Schritt kostet 0,1, das Ziel bringt +10, eine Falle −10; Ziel und Fallen beenden die Episode. Die beiden Fallen unterbrechen die untere Reihe zwischen Start und Ziel – der kürzeste Weg führt direkt an ihrer Kante entlang.
Ist der Boden rutschig, führt eine Aktion nur mit 80 % Wahrscheinlichkeit in die gewählte Richtung und mit je 10 % seitlich daneben. Dann ist jeder Schritt neben einer Falle ein Risiko.
Value Iteration kennt diese Übergänge und die Belohnungen . Ein Sweep berechnet für jedes Feld neu
und hört auf, sobald sich kein Wert mehr um mehr als 0,0001 ändert. Die Pfeile zeigen die Aktionen, die das Maximum erreichen; der Rahmen markiert die Route, die man ab dem Start entlang der Pfeile geht.
Q-Learning kennt das Modell nicht. Der Agent wählt mit Wahrscheinlichkeit eine zufällige Richtung, sonst die mit dem größten Q-Wert, und passt nach jedem Schritt die Schätzung an:
Die Felder zeigen , das Diagramm den Return jeder Episode – die Summe der Belohnungen – und seinen gleitenden Mittelwert.
Drei Dinge zum Ausprobieren
- Rutschig machen. Schalten Sie „Rutschig“ ein. Die beste Route weicht dann eine Reihe nach oben aus: Zwei zusätzliche Schritte sind billiger als das Risiko, neben den Fallen abzurutschen. Der Wert des Startfeldes sinkt von 4,85 auf 2,55.
- Kurzsichtig oder weitsichtig. Senken Sie auf 0,5. Weit entfernte Belohnungen zählen kaum noch; in der Nähe des Starts werden die Werte fast null, und die Werte breiten sich nur noch schwach aus.
- Lernen mit Risiko. Spielen Sie im Q-Learning-Modus mehrmals 100 Episoden. Der Agent lernt den kurzen Weg an der Kante, fällt wegen der Erkundung mit aber in etwa jeder siebten Episode in eine Falle. Mit passiert das später nicht mehr – dafür bleibt er manchmal bei einem Umweg, weil er nichts Neues mehr ausprobiert.
Die Grundlagen – Markov-Entscheidungsprozess, Bellman-Gleichung, Temporal-Difference-Lernen – erklärt der Artikel Reinforcement Learning einfach erklärt.