Entscheiden & Optimieren

Entscheidungstheorie einfach erklärt

Entscheidungstheorie zerlegt eine schwierige Wahl in Handlungen, mögliche Entwicklungen, Wahrscheinlichkeiten und Bewertungen. Ein Einstieg mit Ergebnismatrix, Erwartungsnutzen und einem vollständig durchgerechneten Entscheidungsbaum.

  • 10 Min. Lesezeit
  • Aktualisiert am
  • Redaktion smartlytics

Auf einen Blick

  1. Entscheidungstheorie zerlegt eine Wahl in Handlungen, Zustände, Wahrscheinlichkeiten und Bewertungen – und macht so sichtbar, woran eine Entscheidung tatsächlich hängt.
  2. Der Erwartungswert ist nur für risikoneutrale Entscheider der richtige Maßstab. Der Erwartungsnutzen berücksichtigt die Risikoeinstellung, messbar im Sicherheitsäquivalent.
  3. Entscheidungsbäume rechnen mehrstufige Entscheidungen rückwärts aus und zeigen, was zusätzliche Information höchstens wert ist.

Ob ein Betrieb eine Fertigungslinie ausbaut, eine Ärztin eine Therapie empfiehlt oder ein Team einen Produktlaunch plant: Gewählt werden muss, bevor klar ist, wie sich die Welt entwickelt. Die Entscheidungstheorie gibt dieser Situation eine Struktur. Sie fragt, welche Handlungen zur Wahl stehen, welche Zustände eintreten können, wie wahrscheinlich sie sind und wie die möglichen Ergebnisse zu bewerten sind – und sie leitet daraus ab, welche Wahl zu den eigenen Annahmen und Präferenzen passt (Peterson 2017).

Dabei unterscheidet man zwei Perspektiven. Die normative Entscheidungstheorie beschreibt, wie ein konsistenter Entscheider wählen sollte. Die deskriptive Entscheidungstheorie untersucht, wie Menschen tatsächlich entscheiden. Dieser Artikel behandelt vor allem die normative Seite und zeigt am Ende, wo Menschen systematisch davon abweichen.

Die Bausteine einer Entscheidung

Jedes Entscheidungsproblem unter Unsicherheit besteht aus fünf Teilen:

  1. Handlungen, zwischen denen man wählen kann,
  2. Zustände der Welt, die man nicht kontrolliert,
  3. Ergebnisse, die sich aus Handlung und Zustand ergeben,
  4. Wahrscheinlichkeiten der Zustände – sofern man sie angeben kann,
  5. Präferenzen, also eine Bewertung der Ergebnisse.

Ein Beispiel: Ein Betrieb überlegt, eine Fertigungslinie klein, mittel oder groß auszubauen. Die Nachfrage der nächsten Jahre kann niedrig, mittel oder hoch ausfallen. Die Ergebnismatrix zeigt den Gewinn jeder Kombination in Tausend Euro. Die Zahlen sind konstruiert, um die Verfahren zu zeigen; sie sind keine Messwerte.

Ausbau Nachfrage niedrig Nachfrage mittel Nachfrage hoch
klein 20 30 40
mittel 0 50 80
groß −50 30 140

Keine Zeile ist in jeder Spalte die beste. Genau das macht die Entscheidung schwer: Welche Option vorne liegt, hängt davon ab, welcher Zustand eintritt.

Entscheiden, wenn Wahrscheinlichkeiten fehlen

Kann oder will man den Zuständen keine Wahrscheinlichkeiten zuordnen, spricht man von Entscheidungen unter Ungewissheit. Dafür gibt es klassische Regeln:

  • Maximin: Wähle die Handlung, deren schlechtestes Ergebnis am besten ist – die Regel des Pessimisten.
  • Maximax: Wähle die Handlung mit dem besten besten Ergebnis – die Regel des Optimisten.
  • Hurwicz: Gewichte bestes und schlechtestes Ergebnis mit einem Optimismusparameter λ\lambda, also λ⋅max⁡+(1−λ)⋅min⁡\lambda \cdot \max + (1-\lambda) \cdot \min.
  • Minimax-Regret: Bestimme für jeden Zustand, wie viel man gegenüber der dort besten Handlung verschenkt, und wähle die Handlung mit dem kleinsten maximalen Bedauern (Savage 1954).
  • Laplace: Behandle alle Zustände als gleich wahrscheinlich und vergleiche Durchschnitte.

Für die Tabelle oben ergibt sich:

Regel klein mittel groß Wahl
Maximin (schlechtestes Ergebnis) 20 0 −50 klein
Maximax (bestes Ergebnis) 40 80 140 groß
Hurwicz mit λ=0,5\lambda = 0{,}5 30 40 45 groß
Minimax-Regret (größtes Bedauern) 100 60 70 mittel
Laplace (Durchschnitt) 30 43,3 40 mittel

Das Bedauern berechnet man spaltenweise: Die besten Ergebnisse je Zustand sind 20, 50 und 140. Wer klein ausbaut und hohe Nachfrage erlebt, verschenkt 140−40=100140 - 40 = 100; das ist das größte Bedauern dieser Zeile.

Der Erwartungswert

Sobald man den Zuständen Wahrscheinlichkeiten zuordnen kann – aus Daten, Modellen oder begründeter Einschätzung –, lässt sich jede Handlung aa durch ihren Erwartungswert zusammenfassen:

E[Xa]=∑sP(s) x(a,s)\E[X_a] = \sum_{s} P(s)\, x(a, s)

Nimmt der Betrieb für niedrige, mittlere und hohe Nachfrage die Wahrscheinlichkeiten 0,3, 0,5 und 0,2 an, ergibt sich:

E[klein]=0,3⋅20+0,5⋅30+0,2⋅40=29E[mittel]=0,3⋅0+0,5⋅50+0,2⋅80=41E[groß]=0,3⋅(−50)+0,5⋅30+0,2⋅140=28\begin{aligned} \E[\text{klein}] &= 0{,}3 \cdot 20 + 0{,}5 \cdot 30 + 0{,}2 \cdot 40 = 29\\ \E[\text{mittel}] &= 0{,}3 \cdot 0 + 0{,}5 \cdot 50 + 0{,}2 \cdot 80 = 41\\ \E[\text{groß}] &= 0{,}3 \cdot (-50) + 0{,}5 \cdot 30 + 0{,}2 \cdot 140 = 28 \end{aligned}

Nach dem Erwartungswert ist der mittlere Ausbau die beste Wahl. Die Begründung ist das Gesetz der großen Zahlen: Wer dieselbe Entscheidung sehr oft unter gleichen Bedingungen trifft, erzielt im Durchschnitt ungefähr den Erwartungswert. Für eine einmalige, große Entscheidung fehlt dem Erwartungswert aber eine wichtige Information – die Streuung. Die Standardabweichung der Ergebnisse beträgt bei „klein“ 7, bei „mittel“ 29,1 und bei „groß“ 65,9 Tausend Euro. Der große Ausbau kann 50 Tausend Euro Verlust bedeuten, und das zählt für viele Entscheider mehr als sein Erwartungswert verrät.

Erwartungsnutzen: wenn Risiko zählt

Das St.-Petersburg-Paradox

Das Problem stammt von Nikolaus Bernoulli; sein Cousin Daniel Bernoulli hat 1738 die bis heute zitierte Lösung vorgeschlagen (Bernoulli 1738/1954). Eine faire Münze wird so lange geworfen, bis zum ersten Mal Kopf fällt. Geschieht das im kk-ten Wurf, erhält man 2k2^k Dukaten. Der Erwartungswert ist unendlich, denn jeder Summand trägt genau einen Dukaten bei:

E[X]=∑k=1∞12k⋅2k=1+1+1+⋯=∞\E[X] = \sum_{k=1}^{\infty} \frac{1}{2^k} \cdot 2^k = 1 + 1 + 1 + \dots = \infty

Trotzdem würde kaum jemand mehr als einen kleinen Betrag für die Teilnahme bezahlen. Bernoullis Erklärung: Der Wert zusätzlichen Geldes nimmt mit dem Vermögen ab. Bewertet man Gewinne logarithmisch, ist der erwartete Nutzen endlich, E[ln⁡X]=∑kkln⁡2/2k=2ln⁡2\E[\ln X] = \sum_k k \ln 2 / 2^k = 2 \ln 2, und das Spiel ist so viel wert wie ein sicherer Gewinn von e2ln⁡2=4e^{2\ln 2} = 4 Dukaten (ohne Berücksichtigung des vorhandenen Vermögens).

Die Idee des Erwartungsnutzens

John von Neumann und Oskar Morgenstern haben gezeigt: Erfüllen Präferenzen über Lotterien einige Konsistenzaxiome – Vollständigkeit, Transitivität, Stetigkeit und Unabhängigkeit –, dann gibt es eine Nutzenfunktion uu, sodass man genau die Lotterie mit dem höheren Erwartungsnutzen vorzieht (von Neumann & Morgenstern 1944):

EU(a)=∑sP(s) u(x(a,s))\text{EU}(a) = \sum_s P(s)\, u\big(x(a, s)\big)

Leonard Savage hat diesen Ansatz auf subjektive Wahrscheinlichkeiten übertragen (Savage 1954). Die Form der Nutzenfunktion beschreibt die Risikoeinstellung. Ist uu konkav, gilt u(E[X])≥E[u(X)]u(\E[X]) \ge \E[u(X)]: Ein sicherer Betrag in Höhe des Erwartungswerts ist mindestens so viel wert wie die Lotterie selbst. Das ist Risikoaversion.

Sicherheitsäquivalent und Risikoprämie

Das Sicherheitsäquivalent (SÄ) einer riskanten Alternative ist der sichere Betrag mit demselben Nutzen, u(SA¨)=E[u(X)]u(\text{SÄ}) = \E[u(X)]. Die Differenz zwischen Erwartungswert und Sicherheitsäquivalent heißt Risikoprämie: So viel erwarteten Gewinn gibt ein Entscheider auf, um das Risiko loszuwerden.

In der Entscheidungsanalyse ist die exponentielle Nutzenfunktion verbreitet, weil sie mit einem einzigen Parameter auskommt, der Risikotoleranz RR (Howard & Abbas 2016):

u(x)=1−e−x/R,SA¨=−R ln⁡E ⁣[e−X/R]u(x) = 1 - e^{-x/R}, \qquad \text{SÄ} = -R \,\ln \E\!\left[e^{-X/R}\right]

Mit einer Risikotoleranz von R=100R = 100 Tausend Euro ergibt sich für den Ausbau der Fertigungslinie:

Ausbau Erwartungswert Standardabweichung Sicherheitsäquivalent Risikoprämie
klein 29,0 7,0 28,8 0,2
mittel 41,0 29,1 36,7 4,3
groß 28,0 65,9 9,0 19,0

Der mittlere Ausbau bleibt vorne, aber der große verliert deutlich: Sein Sicherheitsäquivalent liegt bei nur 9 Tausend Euro, weil der mögliche Verlust von 50 Tausend Euro schwer wiegt. Wäre der Betrieb noch vorsichtiger, würde sich die Rangfolge drehen – unterhalb einer Risikotoleranz von etwa 34 Tausend Euro wäre der kleine Ausbau die beste Wahl.

Entscheidungsbäume: mehrstufig denken

Viele Entscheidungen fallen nicht auf einmal. Oft kann man zuerst Information sammeln und danach entscheiden. Ein Entscheidungsbaum stellt solche Abfolgen dar: Quadrate sind Entscheidungen, Kreise Zufallsereignisse, an den Enden stehen die Ergebnisse (Raiffa 1968).

Entscheidungsbaum: Sofort einführen hat den Erwartungswert 60, nicht einführen 0, der Markttest nach Abzug seiner Kosten 108 Tausend Euro. Nach positivem Test wird eingeführt (276), nach negativem gestoppt (0). Sofort einführen Nicht einführen Markttest (−30) Erfolg 0,4 Flop 0,6 positiv 0,5 negativ 0,5 108 60 138 +600 −300 0 einführen: 276 stoppen: 0
Entscheidungsbaum für den Produktlaunch (Werte in Tausend Euro). Quadrate sind Entscheidungen, Kreise Zufallsereignisse. Die Zahlen an den Knoten sind die Ergebnisse der Rückwärtsrechnung; farbig markiert ist die beste Strategie.

Rückwärtsrechnung

Gelöst wird ein Entscheidungsbaum von rechts nach links: An jedem Zufallsknoten bildet man den Erwartungswert, an jedem Entscheidungsknoten wählt man den besten Ast (Clemen & Reilly 2014).

  1. Sofort einführen: 0,4⋅600+0,6⋅(−300)=600{,}4 \cdot 600 + 0{,}6 \cdot (-300) = 60.
  2. Testergebnis: Ein positives Ergebnis tritt mit Wahrscheinlichkeit 0,8⋅0,4+0,3⋅0,6=0,50{,}8 \cdot 0{,}4 + 0{,}3 \cdot 0{,}6 = 0{,}5 ein. Nach dem Satz von Bayes steigt die Erfolgswahrscheinlichkeit dann auf 0,32/0,5=0,640{,}32 / 0{,}5 = 0{,}64; nach einem negativen Ergebnis sinkt sie auf 0,08/0,5=0,160{,}08 / 0{,}5 = 0{,}16.
  3. Nach positivem Test bringt die Einführung 0,64⋅600−0,36⋅300=2760{,}64 \cdot 600 - 0{,}36 \cdot 300 = 276 – also einführen. Nach negativem Test ergäbe sie 0,16⋅600−0,84⋅300=−1560{,}16 \cdot 600 - 0{,}84 \cdot 300 = -156 – also stoppen.
  4. Markttest insgesamt: 0,5⋅276+0,5⋅0=1380{,}5 \cdot 276 + 0{,}5 \cdot 0 = 138, abzüglich der Testkosten 138−30=108138 - 30 = 108.

An der Wurzel steht damit max⁡(60; 0; 108)=108\max(60;\ 0;\ 108) = 108. Die beste Strategie lautet: erst testen, bei positivem Ergebnis einführen, bei negativem stoppen. Sie hat einen um 48 Tausend Euro höheren Erwartungswert als die sofortige Einführung.

Was ist Information wert?

Der Baum beantwortet eine zweite, oft wichtigere Frage: Wie viel darf Information kosten? Der Wert der vollkommenen Information (EVPI, expected value of perfect information) vergleicht zwei Welten. Wüsste das Team vorher sicher, ob das Produkt ein Erfolg wird, würde es nur im Erfolgsfall einführen und erwartete 0,4⋅600+0,6⋅0=2400{,}4 \cdot 600 + 0{,}6 \cdot 0 = 240. Ohne Information sind es 60. Also gilt:

EVPI=E[max⁡ax(a,S)]−max⁡aE[x(a,S)]=240−60=180\text{EVPI} = \E\Big[\max_a x(a, S)\Big] - \max_a \E\big[x(a, S)\big] = 240 - 60 = 180

Kein Test, keine Studie und kein Datensatz kann diese Entscheidung um mehr als 180 Tausend Euro verbessern. Der unvollkommene Markttest ist 138−60=78138 - 60 = 78 Tausend Euro wert, das ist der Wert der Stichprobeninformation (EVSI). Er liegt über den Testkosten von 30 und schöpft rund 43 % des maximal möglichen Informationswerts aus. Beide Begriffe gehen auf die bayessche Entscheidungstheorie von Howard Raiffa und Robert Schlaifer zurück (Raiffa & Schlaifer 1961).

Wie Menschen tatsächlich entscheiden

Der Erwartungsnutzen ist ein normatives Modell. Menschen weichen davon systematisch ab. Maurice Allais hat das 1953 mit einem berühmten Paar von Wahlen gezeigt (Allais 1953). In der üblichen Lehrbuchfassung lauten sie:

  • Wahl 1: A = 1 Mio. € sicher; B = 10 % Chance auf 5 Mio. €, 89 % auf 1 Mio. €, 1 % auf nichts.
  • Wahl 2: C = 11 % Chance auf 1 Mio. €, sonst nichts; D = 10 % Chance auf 5 Mio. €, sonst nichts.

Viele bevorzugen A und D. Mit Erwartungsnutzen ist das unvereinbar, denn beide Vergleiche laufen auf dieselbe Ungleichung hinaus:

A≻B  ⟺  0,11 u(1)>0,10 u(5)+0,01 u(0)  ⟺  C≻D\text{A} \succ \text{B} \iff 0{,}11\,u(1) > 0{,}10\,u(5) + 0{,}01\,u(0) \iff \text{C} \succ \text{D}

Daniel Kahneman und Amos Tversky haben solche Befunde in der Prospect Theory zusammengeführt (Kahneman & Tversky 1979): Menschen bewerten Ergebnisse relativ zu einem Referenzpunkt, Verluste wiegen schwerer als gleich große Gewinne, und kleine Wahrscheinlichkeiten werden übergewichtet. Das ist keine Widerlegung der normativen Theorie, sondern ein Hinweis, wo Entscheidungen Unterstützung brauchen: bei der expliziten Formulierung von Wahrscheinlichkeiten, Referenzpunkten und Risikoeinstellung.

Gute Entscheidung, schlechtes Ergebnis

Im Beispiel führt das Team nach einem positiven Test ein – und erlebt trotzdem mit 36 % Wahrscheinlichkeit einen Flop. War die Entscheidung dann schlecht? Nein. Ronald Howard betont die Trennung von Entscheidungsqualität und Ergebnisqualität: Eine Entscheidung ist gut, wenn sie zu den verfügbaren Informationen, Alternativen und Präferenzen passt; das Ergebnis hängt zusätzlich vom Zufall ab (Howard & Abbas 2016).

Daraus folgen drei praktische Regeln:

  1. Annahmen dokumentieren. Wer Erfolgswahrscheinlichkeit und Testgüte festhält, kann später prüfen, welche Annahme falsch war.
  2. Über viele Entscheidungen lernen. Ob Wahrscheinlichkeiten gut kalibriert sind, zeigt sich erst über eine Reihe von Fällen.
  3. Optionen vergleichen, bevor Ressourcen gebunden werden. Ein Entscheidungsbaum macht sichtbar, wo zusätzliche Information am meisten bringt.

Fazit

Entscheidungstheorie verlangt keine exotische Mathematik, sondern Disziplin: Handlungen, Zustände, Wahrscheinlichkeiten und Bewertungen werden getrennt aufgeschrieben. Der Erwartungswert ist der natürliche Startpunkt, der Erwartungsnutzen ergänzt die Risikoeinstellung, und Entscheidungsbäume zeigen, wann es sich lohnt, erst zu lernen und dann zu handeln. Wie man die beste zulässige Handlung findet, wenn es nicht drei, sondern Millionen Optionen gibt, zeigt der Artikel zur Optimierung. Wo die Wahrscheinlichkeiten herkommen, erklärt die Bayessche Statistik.

Häufige Fragen

Was ist der Unterschied zwischen Erwartungswert und Erwartungsnutzen?

Der Erwartungswert mittelt die Ergebnisse selbst, gewichtet mit ihren Wahrscheinlichkeiten. Der Erwartungsnutzen mittelt stattdessen den Nutzen der Ergebnisse. Ist die Nutzenfunktion konkav, zählen hohe Verluste stärker als gleich hohe Gewinne – der Erwartungsnutzen bildet damit Risikoaversion ab, der Erwartungswert nicht.

Wie berechnet man einen Entscheidungsbaum?

Von rechts nach links: An jedem Zufallsknoten bildet man den Erwartungswert (oder Erwartungsnutzen) der nachfolgenden Äste, an jedem Entscheidungsknoten wählt man den Ast mit dem besten Wert. Am Ende steht an der Wurzel der Wert der besten Strategie – und die Äste, die man unterwegs gewählt hat, bilden diese Strategie.

Was bedeutet der Wert der vollkommenen Information (EVPI)?

Der EVPI ist die Differenz zwischen dem erwarteten Ergebnis, wenn man vor der Entscheidung wüsste, welcher Zustand eintritt, und dem besten erwarteten Ergebnis ohne diese Information. Keine Studie, kein Test und kein Datensatz kann für diese Entscheidung mehr wert sein.

Ist eine Entscheidung schlecht, wenn das Ergebnis schlecht ist?

Nicht unbedingt. Eine Entscheidung ist gut, wenn sie zu den damals verfügbaren Informationen, Alternativen und Präferenzen passt. Auch eine gute Entscheidung kann wegen des Zufalls ein schlechtes Ergebnis haben – beurteilen sollte man deshalb den Prozess und die Annahmen, nicht nur den Ausgang.

Quellen und weiterführende Literatur

  1. Buchvon Neumann, J. und Morgenstern, O. (1944): Theory of Games and Economic Behavior. Princeton University Press.Die axiomatische Begründung des Erwartungsnutzens steht im Anhang der zweiten Auflage (1947).
  2. PaperBernoulli, D. (1954): Exposition of a New Theory on the Measurement of Risk. Econometrica 22(1), 23–36 (englische Übersetzung des lateinischen Originals von 1738).
  3. BuchSavage, L. J. (1954): The Foundations of Statistics. Wiley.
  4. BuchRaiffa, H. und Schlaifer, R. (1961): Applied Statistical Decision Theory. Division of Research, Harvard Business School.
  5. BuchRaiffa, H. (1968): Decision Analysis: Introductory Lectures on Choices under Uncertainty. Addison-Wesley.
  6. PaperAllais, M. (1953): Le comportement de l’homme rationnel devant le risque: critique des postulats et axiomes de l’école américaine. Econometrica 21(4), 503–546.
  7. PaperKahneman, D. und Tversky, A. (1979): Prospect Theory: An Analysis of Decision under Risk. Econometrica 47(2), 263–291.
  8. BuchClemen, R. T. und Reilly, T. (2014): Making Hard Decisions with DecisionTools (3. Auflage). South-Western Cengage Learning.Praxisnahes Lehrbuch zu Entscheidungsbäumen, Nutzenfunktionen und Informationswert.
  9. BuchPeterson, M. (2017): An Introduction to Decision Theory (2. Auflage). Cambridge University Press.Kompakter, philosophisch sorgfältiger Überblick über normative Entscheidungstheorie.
  10. BuchHoward, R. A. und Abbas, A. E. (2016): Foundations of Decision Analysis. Pearson.

Zuletzt fachlich geprüft am 25. September 2026. Hinweise auf Fehler nehmen wir gern entgegen: impressum@nyxai.com.

Von NyxAI

smartlytics ist das Wissensangebot der NyxAI GmbH.

Wir erklären hier die Methoden, mit denen wir arbeiten – offen, mit Quellen und so, dass man sie nachrechnen kann.

nyxai.com

Entscheidungskern

NyxAI entwickelt einen Entscheidungskern (Decision Core) für Decision Intelligence, der Optimierung, Simulation, Statistik und Reinforcement Learning verbindet: Optionen vergleichen, Unsicherheit sichtbar machen, aus Ergebnissen lernen – unter menschlicher Verantwortung.

Plattform ansehen

DeepSquare

Erklärbare Schach-KI mit menschlichen Spielstilen: das Testfeld von NyxAI für nachvollziehbare Entscheidungen unter Zeitdruck.

DeepSquare bei NyxAI
deepsquare.aibald