Bayes & Statistik

Bayessche Statistik einfach erklärt

Bayessche Statistik behandelt Wahrscheinlichkeit als Maß für begründete Überzeugung – und beschreibt präzise, wie neue Daten diese Überzeugung verändern. Ein Einstieg mit Beispielen, sauberer Mathematik und einem Explainer zum Ausprobieren.

  • 9 Min. Lesezeit
  • Aktualisiert am
  • Redaktion smartlytics

Auf einen Blick

  1. Der Satz von Bayes verbindet Vorwissen (Prior) und Daten (Likelihood) zu einer aktualisierten Einschätzung (Posterior).
  2. Das Ergebnis ist eine ganze Verteilung: Sie zeigt den plausibelsten Wert und wie unsicher er ist.
  3. Bayessche und frequentistische Verfahren beantworten unterschiedliche Fragen. Wer ein Konfidenzintervall wie eine Wahrscheinlichkeitsaussage liest, zieht falsche Schlüsse.

Wer eine Entscheidung treffen muss, hat fast nie vollständige Information. Eine Konversionsrate ist nur geschätzt, ein Testergebnis kann falsch sein, eine Prognose streut. Bayessche Statistik ist die Methode, genau diese Unsicherheit ernst zu nehmen: Sie beschreibt unbekannte Größen mit Wahrscheinlichkeitsverteilungen und aktualisiert diese Verteilungen, sobald Daten eintreffen. Das Verfahren geht auf Thomas Bayes zurück, dessen Aufsatz 1763 posthum erschien (Bayes 1763); Pierre-Simon Laplace hat es wenig später verallgemeinert und breit angewendet.

Wahrscheinlichkeit als Grad begründeter Überzeugung

In der klassischen, frequentistischen Lesart ist eine Wahrscheinlichkeit eine relative Häufigkeit in (gedachten) Wiederholungen: Eine faire Münze zeigt auf lange Sicht in der Hälfte der Würfe Kopf. Unbekannte Größen – etwa die wahre Konversionsrate einer Landingpage – sind in dieser Lesart feste Zahlen; zufällig sind nur die Daten.

Die bayessche Lesart erlaubt zusätzlich, Wahrscheinlichkeiten für Aussagen über unbekannte Größen anzugeben: „Die Konversionsrate liegt mit 90 % Wahrscheinlichkeit zwischen 3 und 5 %.“ Wahrscheinlichkeit wird so zu einem Maß für begründete Überzeugung, das den Regeln der Wahrscheinlichkeitsrechnung folgt. Edwin T. Jaynes hat gezeigt, dass sich diese Regeln als konsistente Erweiterung der klassischen Logik auf unsichere Aussagen verstehen lassen (Jaynes 2003).

Das ist keine Beliebigkeit. Die Überzeugung ist an Annahmen und Daten gebunden, und sie muss sich an beiden messen lassen.

Der Satz von Bayes

Aus der Produktregel P(H∩D)=P(H∣D) P(D)=P(D∣H) P(H)P(H \cap D) = P(H \mid D)\,P(D) = P(D \mid H)\,P(H) folgt unmittelbar der Satz von Bayes für eine Hypothese HH und beobachtete Daten DD:

P(H∣D)=P(D∣H) P(H)P(D)P(H \mid D) = \frac{P(D \mid H)\,P(H)}{P(D)}

Die vier Bausteine haben feste Namen:

  • Prior P(H)P(H): Wie plausibel ist die Hypothese vor den Daten?
  • Likelihood P(D∣H)P(D \mid H): Wie wahrscheinlich wären genau diese Daten, wenn die Hypothese stimmt?
  • Evidenz P(D)=∑iP(D∣Hi) P(Hi)P(D) = \sum_i P(D \mid H_i)\,P(H_i): die Gesamtwahrscheinlichkeit der Daten über alle betrachteten Hypothesen – der Normierungsfaktor.
  • Posterior P(H∣D)P(H \mid D): Wie plausibel ist die Hypothese nach den Daten?

Weil die Evidenz nicht von HH abhängt, merkt man sich den Satz meist in der Kurzform „Posterior ist proportional zu Likelihood mal Prior“:

P(H∣D)∝P(D∣H) P(H)P(H \mid D) \propto P(D \mid H)\,P(H)

Ein Beispiel, das fast alle falsch schätzen

Eine Krankheit tritt bei 1 % der untersuchten Personen auf. Ein Test erkennt 90 % der Erkrankten (Sensitivität) und schlägt bei 9 % der Gesunden fälschlich an (Falsch-positiv-Rate). Eine Person wird positiv getestet. Wie wahrscheinlich ist sie tatsächlich erkrankt?

Viele Menschen – auch Fachleute – schätzen spontan etwas um 90 %. Gerd Gigerenzer und Ulrich Hoffrage haben gezeigt, dass die richtige Antwort viel leichter fällt, wenn man mit natürlichen Häufigkeiten statt mit Prozenten rechnet (Gigerenzer & Hoffrage 1995):

Von 1.000 Personen Test positiv Test negativ Summe
erkrankt 9 1 10
gesund 89 901 990
Summe 98 902 1.000

Von den 98 positiv Getesteten sind nur 9 erkrankt – also rund 9 %. Mit dem Satz von Bayes:

P(K∣+)=0,90⋅0,010,90⋅0,01+0,09⋅0,99=0,0090,0981≈0,092P(K \mid +) = \frac{0{,}90 \cdot 0{,}01}{0{,}90 \cdot 0{,}01 + 0{,}09 \cdot 0{,}99} = \frac{0{,}009}{0{,}0981} \approx 0{,}092

Der Posterior von 9,2 % ist viel kleiner als die Sensitivität, weil die Krankheit selten ist: Unter den vielen Gesunden erzeugen schon 9 % Fehlalarme mehr positive Befunde als unter den wenigen Erkrankten.

Das Beispiel zeigt auch, warum Bayes ein Lernverfahren ist. Fällt ein zweiter, unabhängiger Test ebenfalls positiv aus, wird der bisherige Posterior zum neuen Prior:

P(K∣+,+)=0,90⋅0,0920,90⋅0,092+0,09⋅0,908≈0,50P(K \mid +,+) = \frac{0{,}90 \cdot 0{,}092}{0{,}90 \cdot 0{,}092 + 0{,}09 \cdot 0{,}908} \approx 0{,}50

Nach zwei positiven Befunden steht es also etwa fünfzig zu fünfzig. Die Rechnung setzt voraus, dass die Fehler der beiden Tests bei gegebenem Krankheitsstatus unabhängig sind; wiederholt man denselben Test mit derselben Fehlerquelle, gilt das nicht.

Von Hypothesen zu Parametern

In der Praxis geht es selten um zwei Hypothesen, sondern um einen unbekannten Zahlenwert: eine Erfolgsquote, eine mittlere Lieferzeit, einen Effekt. Für einen stetigen Parameter θ\theta lautet der Satz von Bayes mit Dichten statt Wahrscheinlichkeiten:

p(θ∣y)=p(y∣θ) p(θ)∫p(y∣θ′) p(θ′)  dθ′p(\theta \mid y) = \frac{p(y \mid \theta)\,p(\theta)}{\int p(y \mid \theta')\,p(\theta')\,\d\theta'}

Die Struktur ist dieselbe. Der Nenner ist wieder nur eine Normierung – er sorgt dafür, dass die Fläche unter dem Posterior 1 ergibt.

Der Prior: Annahmen sichtbar machen

Der Prior p(θ)p(\theta) beschreibt, welche Werte vor den Daten plausibel sind. Er kann flach sein (alle Werte gleich plausibel), schwach informativ (schließt Unsinn aus, ohne viel vorzugeben) oder informativ (fasst belastbares Vorwissen aus früheren Studien zusammen). Ein Prior ist kein Trick, um sich ein Ergebnis zu wünschen: Er ist eine überprüfbare Annahme. Man kann ihn begründen, dokumentieren und mit sogenannten Prior-Predictive-Checks testen – also simulieren, welche Daten er erwarten ließe, bevor man echte Daten ansieht (Gelman et al. 2020).

Die Likelihood: was die Daten sagen

Die Likelihood p(y∣θ)p(y \mid \theta) ist dieselbe Funktion, die auch frequentistische Verfahren verwenden. Bei festen Daten beschreibt sie, wie gut jeder mögliche Parameterwert die Beobachtungen erklärt. Für kk Erfolge in nn unabhängigen Versuchen mit Erfolgswahrscheinlichkeit θ\theta ist das die Binomialverteilung:

p(k∣n,θ)=(nk) θk (1−θ)n−kp(k \mid n, \theta) = \binom{n}{k}\,\theta^{k}\,(1-\theta)^{n-k}

Wichtig: Als Funktion von θ\theta ist die Likelihood keine Wahrscheinlichkeitsdichte – ihre Fläche muss nicht 1 ergeben. Erst die Multiplikation mit dem Prior und die Normierung machen daraus eine Verteilung.

Der Posterior: Prior mal Likelihood

Besonders anschaulich wird die Rechnung mit einer Beta-Verteilung als Prior. Ihre Dichte ist proportional zu θα−1(1−θ)β−1\theta^{\alpha-1}(1-\theta)^{\beta-1}. Multipliziert man sie mit der Binomial-Likelihood, addieren sich einfach die Exponenten:

θα−1(1−θ)β−1⏟Prior⋅θk(1−θ)n−k⏟Likelihood=θα+k−1(1−θ)β+n−k−1\underbrace{\theta^{\alpha-1}(1-\theta)^{\beta-1}}_{\text{Prior}} \cdot \underbrace{\theta^{k}(1-\theta)^{n-k}}_{\text{Likelihood}} = \theta^{\alpha+k-1}(1-\theta)^{\beta+n-k-1}

Der Posterior ist also wieder eine Beta-Verteilung:

θ∣k∼Beta⁡(α+k,  β+n−k)\theta \mid k \sim \Beta(\alpha + k,\; \beta + n - k)

Prior und Posterior stammen aus derselben Familie; man nennt den Beta-Prior deshalb konjugiert zur Binomial-Likelihood. Die Parameter lassen sich als Pseudo-Beobachtungen lesen: α\alpha „Erfolge“ und β\beta „Misserfolge“, die man vor den Daten schon gesehen zu haben glaubt.

Der Posterior-Mittelwert ist dabei ein gewichteter Durchschnitt aus Prior-Mittelwert und beobachteter Quote:

E[θ∣k]=α+kα+β+n=w⋅αα+β+(1−w)⋅kn,w=α+βα+β+n\E[\theta \mid k] = \frac{\alpha + k}{\alpha + \beta + n} = w \cdot \frac{\alpha}{\alpha + \beta} + (1 - w) \cdot \frac{k}{n}, \qquad w = \frac{\alpha + \beta}{\alpha + \beta + n}

Im Beispiel ist w=10/30w = 10/30: Die Daten zählen doppelt so viel wie das Vorwissen, und der Schätzer landet zwischen 20 % und 35 %. Mit wachsendem nn geht ww gegen null – die Daten setzen sich durch. Dieses Zusammenziehen zum Vorwissen hin heißt Shrinkage und schützt gerade bei kleinen Stichproben vor extremen Schätzungen.

Interaktiv

Bayes-Update live: Prior, Likelihood und Posterior

Der interaktive Explainer zeigt Prior, normierte Likelihood und Posterior einer Erfolgsquote. Ohne JavaScript bleibt die Rechnung aus dem Beispiel oben gültig: Prior Beta(2, 8), 7 Erfolge in 20 Versuchen, Posterior Beta(9, 21).

Was der Posterior liefert

Weil der Posterior eine vollständige Verteilung ist, beantwortet er viele Fragen direkt:

  • Punktschätzer: Mittelwert, Median oder Modus (der Modus heißt auch MAP-Schätzer). Welcher sinnvoll ist, hängt davon ab, welche Fehler teuer sind – eine Frage der Entscheidungstheorie.
  • Intervalle: Ein 95-%-Kredibilitätsintervall enthält θ\theta mit 95 % Wahrscheinlichkeit, gegeben Modell, Prior und Daten. Üblich sind das zentrale Intervall (2,5 % und 97,5 % Quantil) und das Intervall höchster Dichte (HDI).
  • Wahrscheinlichkeiten für Aussagen: P(θ>0,25∣y)P(\theta > 0{,}25 \mid y) ist einfach die Fläche des Posteriors rechts von 0,25.
  • Vorhersagen: Die Posterior-Predictive-Verteilung mittelt über alle plausiblen Parameterwerte. Im Beta-Binomial-Modell ist die Wahrscheinlichkeit, dass der nächste Versuch ein Erfolg wird, genau der Posterior-Mittelwert. Mit flachem Prior ergibt das Laplaces Folgeregel (k+1)/(n+2)(k+1)/(n+2).

Diese direkten Aussagen sind der Grund, warum bayessche Verfahren so gut zu Entscheidungen passen. Die Frage „Wie wahrscheinlich ist Variante B besser als A?“ ist bayessch eine einfache Integration – der Artikel zum Bayes A/B-Test zeigt, wie das in der Praxis aussieht.

Bayes vs. frequentistisch: ein ehrlicher Vergleich

Beide Schulen nutzen dieselbe Wahrscheinlichkeitsrechnung und oft dieselben Modelle. Sie beantworten aber unterschiedliche Fragen:

Frequentistisch Bayessch
Was ist unsicher? die Daten, bei festem unbekanntem Parameter der Parameter, beschrieben durch eine Verteilung
Typisches Ergebnis Schätzer, Konfidenzintervall, p-Wert Posterior, Kredibilitätsintervall, Wahrscheinlichkeiten für Aussagen
Bedeutung eines 95-%-Intervalls Das Verfahren überdeckt den wahren Wert in 95 % der Wiederholungen Der Parameter liegt mit 95 % Wahrscheinlichkeit im Intervall – gegeben Modell und Prior
Vorwissen indirekt über Design und Modellwahl explizit über den Prior
Stärke kontrollierte Fehlerraten über viele Wiederholungen direkte Aussagen für eine konkrete Entscheidung
Typisches Risiko p-Werte werden als Wahrscheinlichkeit der Nullhypothese missverstanden unbegründete oder ungeprüfte Priors

Ein p-Wert ist die Wahrscheinlichkeit, unter der Nullhypothese ein mindestens so extremes Ergebnis zu beobachten wie das tatsächlich beobachtete. Er ist ausdrücklich nicht die Wahrscheinlichkeit, dass die Nullhypothese stimmt. Die American Statistical Association hat 2016 in einer vielzitierten Stellungnahme vor dieser und weiteren Fehlinterpretationen gewarnt (Wasserstein & Lazar 2016).

In der Praxis liegen die Zahlen oft näher beieinander, als die Philosophie vermuten lässt: Bei vielen Daten und schwachem Prior stimmen Kredibilitäts- und Konfidenzintervalle numerisch häufig nahezu überein. Der Unterschied liegt dann vor allem in der Interpretation – und in der Frage, welche Aussage man für eine Entscheidung eigentlich braucht.

Wenn es keine geschlossene Formel gibt

Konjugierte Paare wie Beta und Binomial sind bequem, aber eher die Ausnahme. Für realistische Modelle mit vielen Parametern lässt sich der Posterior meist nicht als Formel hinschreiben. Dann simuliert man ihn: Markov-Chain-Monte-Carlo-Verfahren erzeugen eine Folge von Parameterwerten, deren Häufigkeiten dem Posterior entsprechen. Die Idee reicht bis zum Metropolis-Algorithmus zurück (Metropolis et al. 1953); heutige Werkzeuge wie Stan nutzen Hamiltonian Monte Carlo mit dem No-U-Turn-Sampler (Hoffman & Gelman 2014). Wie Zufallsstichproben überhaupt zu verlässlichen Zahlen werden, erklärt der Artikel zur Monte-Carlo-Simulation.

Typische Fehler – und wie man sie vermeidet

  1. Den Prior verschweigen. Jeder Prior gehört dokumentiert und begründet. Eine Sensitivitätsanalyse zeigt, ob das Ergebnis an der Wahl hängt.
  2. Das Modell vergessen. Auch ein Posterior gilt nur innerhalb des Modells. Posterior-Predictive-Checks vergleichen simulierte mit echten Daten und decken Fehlspezifikationen auf (Gelman et al. 2013).
  3. Die Basisrate ignorieren. Das Testbeispiel zeigt, wie stark die Ausgangswahrscheinlichkeit das Ergebnis prägt.
  4. Einzelne Zahlen statt Verteilungen berichten. Ein Mittelwert ohne Intervall verschweigt genau die Information, für die man bayessch rechnet.
  5. Zu glauben, Bayes löse alle Stoppregel-Fragen. Der Posterior bleibt auch bei laufender Auswertung korrekt berechnet. Welche Fehlerraten eine Entscheidungsregel über viele Experimente hat, ist aber eine eigene Frage, die man vorab klären sollte.

Fazit

Bayessche Statistik ist im Kern eine einzige Regel: Posterior ist proportional zu Likelihood mal Prior. Daraus folgt eine Arbeitsweise, die Vorwissen offenlegt, Unsicherheit als Verteilung mitführt und Aussagen liefert, die direkt zu Entscheidungen passen. Wer tiefer einsteigen will, findet bei McElreath einen didaktisch starken Zugang (McElreath 2020), bei Kruschke viele durchgerechnete Beispiele (Kruschke 2015) und bei Gelman und Kollegen das umfassende Referenzwerk (Gelman et al. 2013).

Häufige Fragen

Was ist der Unterschied zwischen Prior und Posterior?

Der Prior beschreibt, was man vor den Daten über einen unbekannten Wert annimmt. Der Posterior ist die Verteilung nach den Daten: Er entsteht, indem man den Prior mit der Likelihood der beobachteten Daten multipliziert und neu normiert. Der Posterior von heute kann der Prior von morgen sein.

Ist bayessche Statistik subjektiv?

Sie macht Annahmen explizit, statt sie zu verstecken. Jede Analyse enthält Annahmen (Modell, Datenauswahl, Stoppregel); beim bayesschen Vorgehen steht ein Teil davon ausdrücklich im Prior. Gute Praxis ist, Priors zu begründen, mit Prior-Predictive-Checks zu prüfen und die Empfindlichkeit des Ergebnisses zu testen.

Was ist ein Kredibilitätsintervall?

Ein 95-%-Kredibilitätsintervall enthält den unbekannten Parameter mit 95 % Wahrscheinlichkeit – gegeben Modell, Prior und Daten. Das ist genau die Aussage, die viele fälschlich einem frequentistischen Konfidenzintervall zuschreiben.

Wann lohnt sich ein bayesscher Ansatz?

Vor allem dann, wenn Vorwissen vorhanden ist, wenn Daten knapp sind, wenn man direkte Wahrscheinlichkeitsaussagen für eine Entscheidung braucht (etwa „Wie wahrscheinlich ist B besser als A?“) oder wenn Unsicherheit in Simulationen und Optimierungen weiterverarbeitet werden soll.

Quellen und weiterführende Literatur

  1. PaperBayes, T. (1763): An Essay towards Solving a Problem in the Doctrine of Chances. Philosophical Transactions of the Royal Society of London 53, 370–418.
  2. BuchJaynes, E. T. (2003): Probability Theory: The Logic of Science. Cambridge University Press.Wahrscheinlichkeit als erweiterte Logik – die philosophische und mathematische Grundlage des bayesschen Denkens.
  3. BuchGelman, A., Carlin, J. B., Stern, H. S., Dunson, D. B., Vehtari, A. und Rubin, D. B. (2013): Bayesian Data Analysis (3. Auflage). CRC Press.Das Standardwerk; die Autoren stellen eine PDF-Fassung für den nichtkommerziellen Gebrauch bereit.
  4. BuchMcElreath, R. (2020): Statistical Rethinking: A Bayesian Course with Examples in R and Stan (2. Auflage). CRC Press.Didaktisch hervorragender Einstieg mit Fokus auf Modellbildung.
  5. BuchKruschke, J. K. (2015): Doing Bayesian Data Analysis (2. Auflage). Academic Press.
  6. PaperGigerenzer, G. und Hoffrage, U. (1995): How to improve Bayesian reasoning without instruction: Frequency formats. Psychological Review 102(4), 684–704.
  7. PaperWasserstein, R. L. und Lazar, N. A. (2016): The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician 70(2), 129–133.
  8. PaperMetropolis, N., Rosenbluth, A. W., Rosenbluth, M. N., Teller, A. H. und Teller, E. (1953): Equation of State Calculations by Fast Computing Machines. The Journal of Chemical Physics 21(6), 1087–1092.
  9. PaperHoffman, M. D. und Gelman, A. (2014): The No-U-Turn Sampler: Adaptively Setting Path Lengths in Hamiltonian Monte Carlo. Journal of Machine Learning Research 15, 1593–1623.
  10. PaperGelman, A., Vehtari, A., Simpson, D. et al. (2020): Bayesian Workflow. arXiv:2011.01808.

Zuletzt fachlich geprüft am 25. September 2026. Hinweise auf Fehler nehmen wir gern entgegen: impressum@nyxai.com.

Von NyxAI

smartlytics ist das Wissensangebot der NyxAI GmbH.

Wir erklären hier die Methoden, mit denen wir arbeiten – offen, mit Quellen und so, dass man sie nachrechnen kann.

nyxai.com

Entscheidungskern

NyxAI entwickelt einen Entscheidungskern (Decision Core) für Decision Intelligence, der Optimierung, Simulation, Statistik und Reinforcement Learning verbindet: Optionen vergleichen, Unsicherheit sichtbar machen, aus Ergebnissen lernen – unter menschlicher Verantwortung.

Plattform ansehen

DeepSquare

Erklärbare Schach-KI mit menschlichen Spielstilen: das Testfeld von NyxAI für nachvollziehbare Entscheidungen unter Zeitdruck.

DeepSquare bei NyxAI
deepsquare.aibald