Bayes & Statistik
Bayes A/B-Test: Konversionsraten richtig vergleichen
Ein Bayes A/B-Test beantwortet die Frage, die im Meeting eigentlich gestellt wird: Wie wahrscheinlich ist Variante B besser – um wie viel – und was kostet es, wenn wir uns irren? Ein Leitfaden mit durchgerechnetem Beispiel, ehrlicher Einordnung und Rechner.
Auf einen Blick
- Jede Variante erhält eine Beta-Posterior-Verteilung ihrer Konversionsrate. Daraus folgen direkt P(B > A), ein Intervall für den Uplift und der erwartete Verlust einer Entscheidung.
- Eine hohe Wahrscheinlichkeit, dass B besser ist, sagt noch nichts über die Größe des Effekts. Dafür braucht es das Uplift-Intervall und eine vorab festgelegte Relevanzschwelle.
- Bayes schützt nicht automatisch vor Fehlentscheidungen durch ständiges Nachschauen. Entscheidungsregel, Mindestlaufzeit und Stichprobenplanung gehören vor den Start.
Ein A/B-Test ist ein randomisiertes Experiment: Besucherinnen und Besucher werden zufällig auf zwei Varianten verteilt, und man vergleicht eine Zielgröße – meist die Konversionsrate. Am Ende steht eine Entscheidung: Variante B übernehmen oder bei A bleiben. Der klassische Signifikanztest beantwortet dafür eine indirekte Frage: Wie überraschend wären diese Daten, wenn es gar keinen Unterschied gäbe? Ein bayesscher A/B-Test beantwortet die Fragen, die für die Entscheidung zählen: Wie wahrscheinlich ist B besser, um wie viel – und welches Risiko gehe ich ein?
Dieser Artikel baut auf den Grundlagen aus Bayessche Statistik einfach erklärt auf und rechnet ein vollständiges Beispiel durch. Dieselben Zahlen können Sie im Bayes A/B-Test-Rechner nachvollziehen und verändern.
Das Modell: eine Beta-Verteilung pro Variante
Jede Variante hat eine unbekannte Konversionsrate bzw. . Von zufällig zugeteilten Besuchern konvertieren ; die Anzahl folgt einer Binomialverteilung . Mit einer Beta-Verteilung als Prior ist der Posterior wieder eine Beta-Verteilung:
Für den Einstieg nimmt man für beide Varianten den flachen Prior . Bei Tausenden Besuchern ist sein Einfluss vernachlässigbar. Informatives Vorwissen aus früheren Tests ist erlaubt, sollte aber für A und B identisch sein – sonst bevorzugt der Prior eine Variante, bevor der erste Besucher kommt.
| Variante A | Variante B | |
|---|---|---|
| Besucher | 10.000 | 10.000 |
| Konversionen | 420 | 468 |
| Posterior | Beta(421, 9.581) | Beta(469, 9.533) |
| Posterior-Mittelwert | 4,21 % | 4,69 % |
| 95-%-Kredibilitätsintervall | 3,82 % – 4,61 % | 4,28 % – 5,11 % |
Die beiden Intervalle überlappen. Das allein entscheidet aber nichts: Überlappende Einzelintervalle sind kein Test auf einen Unterschied. Entscheidend ist die gemeinsame Betrachtung beider Posteriors.
Die drei Kennzahlen eines Bayes-A/B-Tests
1. Die Wahrscheinlichkeit, dass B besser ist
Da beide Posteriors unabhängig sind, ist die Wahrscheinlichkeit, dass B die höhere Rate hat, ein einfaches Integral über die Dichte von B und die Verteilungsfunktion von A:
Man kann es numerisch berechnen oder – für ganzzahlige Parameter – exakt mit der Formel, die Evan Miller hergeleitet hat (Miller 2015). Dabei ist die Betafunktion:
Im Beispiel ergibt beides übereinstimmend 95,0 %. Mit 95 % Wahrscheinlichkeit – gegeben Modell, Prior und Daten – hat B die höhere Konversionsrate.
2. Der erwartete Verlust
Die Wahrscheinlichkeit allein ignoriert, wie viel auf dem Spiel steht. Chris Stucchio hat deshalb den erwarteten Verlust als Entscheidungsgröße vorgeschlagen (Stucchio 2015): Wie viel Konversionsrate verliert man im Mittel, wenn man sich für B entscheidet, A aber in Wahrheit besser ist?
Im Beispiel beträgt der erwartete Verlust bei Wahl von B nur 0,006 Prozentpunkte – rund 0,14 % der Basisrate. Bei Wahl von A wären es 0,49 Prozentpunkte. Die Entscheidungsregel lautet: Wähle eine Variante, sobald ihr erwarteter Verlust unter einer vorab festgelegten Schwelle liegt, die geschäftlich nicht mehr ins Gewicht fällt. Stucchio nennt sie „threshold of caring“.
3. Die Größe des Effekts
Für die Entscheidung zählt auch, wie viel besser B ist. Der relative Uplift hat keine einfache geschlossene Verteilung, lässt sich aber mühelos simulieren: Man zieht viele Paare aus den beiden Posteriors und berechnet jedes Mal . Mit 400.000 Ziehungen ergibt sich im Beispiel:
- Median des Uplifts: +11,4 %
- 95-%-Intervall: −2,0 % bis +26,7 %
- Wahrscheinlichkeit für mehr als +5 % Uplift: 81,7 %; für mehr als +10 %: 57,8 %
Das ist die ehrliche Zusammenfassung: B ist wahrscheinlich besser, aber die Größe des Effekts ist noch sehr unsicher – von leicht schlechter bis deutlich besser ist alles plausibel. Wer mit „+11 % Uplift“ in die Präsentation geht, verschweigt die Hälfte der Information.
Bayes A/B-Test-Rechner
Der Rechner benötigt JavaScript. Die Werte des Beispiels: P(B > A) = 95,0 %, erwarteter Verlust bei Wahl von B 0,006 Prozentpunkte, Uplift-Intervall −2,0 % bis +26,7 %.
Bayes und der klassische Test im Vergleich
Der übliche Zwei-Stichproben-Test für Anteile liefert für dieselben Daten und einen zweiseitigen p-Wert von . Nach der üblichen Konvention „nicht signifikant auf dem 5-%-Niveau“ – und trotzdem ist B mit 95 % Wahrscheinlichkeit besser. Widerspricht sich das?
Nein. Mit flachem Prior und großen Stichproben liegt sehr nahe bei eins minus dem einseitigen p-Wert; der beträgt hier 0,0497. Ein zweiseitiger Test auf 5-%-Niveau verlangt also deutlich mehr Evidenz als die Schwelle „95 % Wahrscheinlichkeit, dass B besser ist“. Beide Verfahren sehen dieselbe, eher mäßige Evidenz; sie formulieren sie nur verschieden. Der p-Wert ist dabei nicht die Wahrscheinlichkeit, dass es keinen Unterschied gibt (Wasserstein & Lazar 2016).
| Klassischer Test | Bayes A/B-Test | |
|---|---|---|
| Beantwortete Frage | Wie überraschend sind die Daten, falls ? | Wie wahrscheinlich ist B besser, und um wie viel? |
| Ergebnis im Beispiel | (zweiseitig) | |
| Effektgröße | Konfidenzintervall | Kredibilitätsintervall für den Uplift |
| Risiko einer Entscheidung | nicht direkt | erwarteter Verlust |
| Planung | Power-Analyse für eine Mindesteffektgröße | Simulation der Entscheidungsregel (Pre-Posterior) |
Entscheidungsregeln vorab festlegen
Ein Bayes-A/B-Test liefert Wahrscheinlichkeiten; die Entscheidung braucht eine Regel. Drei Varianten sind verbreitet:
- Schwelle für P(B > A): Übernehme B, wenn . Einfach zu kommunizieren, ignoriert aber die Effektgröße.
- Erwarteter Verlust: Übernehme die Variante, deren erwarteter Verlust unter der „threshold of caring“ liegt (Stucchio 2015). Das verknüpft Statistik direkt mit dem, was eine Fehlentscheidung kostet – ein Grundgedanke der Entscheidungstheorie.
- ROPE: Man definiert eine Region praktischer Äquivalenz, etwa einen Uplift zwischen −1 % und +1 %. Liegt das 95-%-Intervall höchster Dichte vollständig außerhalb, gilt der Unterschied als relevant; liegt es vollständig innerhalb, gelten die Varianten als praktisch gleichwertig; sonst ist die Frage noch offen (Kruschke 2018).
Wichtig ist weniger, welche Regel Sie wählen, als dass Sie sie vor dem Test festlegen – zusammen mit Metrik, Laufzeit und Schwelle.
Peeking und Stoppregeln: was Bayes löst – und was nicht
Ein häufiges Argument für Bayes lautet: Man darf jederzeit nachschauen. Daran ist etwas Wahres. Der Posterior hängt nur von den beobachteten Daten ab, nicht von der Absicht, wann man aufhört; er ist zu jedem Zeitpunkt korrekt berechnet (Rouder 2014). Ein vorab festgelegter Stichprobenumfang ist also keine Voraussetzung für eine gültige Rechnung.
Eine andere Frage ist, wie oft eine Entscheidungsregel über viele Experimente danebenliegt. Wir haben dazu 4.000 A/A-Tests simuliert, also Tests ohne echten Unterschied (beide Raten 4,2 %). Nach jeweils 1.000 Besuchern pro Variante wurde nachgeschaut, bis 20.000; ein „Gewinner“ wurde ausgerufen, sobald über 95 % oder unter 5 % lag:
- bei nur einer Auswertung am Ende: in rund 11 % der A/A-Tests (erwartet sind 10 %, je 5 % pro Richtung),
- beim Stoppen am ersten günstigen Blick über bis zu 20 Auswertungen: in rund 42 % der A/A-Tests.
Der Posterior ist in jedem einzelnen Moment richtig – aber wer so lange schaut, bis eine Zahl gefällt, findet in Experimenten ohne Effekt deutlich öfter einen. Wie gut Optional Stopping funktioniert, hängt davon ab, ob der Prior zu den tatsächlich vorkommenden Effekten passt und was genau man garantieren will (Deng et al. 2016; de Heide & Grünwald 2021). Für die Praxis heißt das: feste Laufzeit, wenige geplante Zwischenauswertungen, eine Stoppregel über den erwarteten Verlust mit Mindestlaufzeit – oder sequentielle Verfahren, die für kontinuierliches Monitoring gebaut sind (Johari et al. 2017).
Wie viele Besucher braucht ein Test?
Auch ein bayesscher Test braucht Planung. Die klassische Faustformel gibt eine gute erste Orientierung. Um einen relativen Uplift von 10 % bei einer Basisrate von 4,2 % (also 4,20 % gegen 4,62 %) mit 80 % Power auf 5-%-Niveau (zweiseitig) zu erkennen, braucht man
Besucher pro Variante. Die Faustregel aus der Praxis von Online-Experimenten liefert mit rund 36.500 fast denselben Wert (Kohavi et al. 2020). Für einen Uplift von nur 5 % steigt der Bedarf auf rund 147.000 pro Variante – halber Effekt, vierfache Stichprobe.
Bayessch plant man, indem man die Entscheidungsregel vorab simuliert (Pre-Posterior-Analyse): Man nimmt einen plausiblen wahren Effekt an, simuliert viele Experimente und zählt, wie oft die Regel greift. Nimmt man einen wahren Uplift von 10 % an, erreicht bei 10.000 Besuchern pro Variante nur etwa 43 % von 2.000 simulierten Experimenten die Schwelle . Das Beispiel oben war für einen Effekt dieser Größe also knapp bemessen – ein Grund mehr, das Uplift-Intervall mitzuberichten.
So berichten Sie das Ergebnis
Ein gutes Ergebnisprotokoll trennt, was die Daten zeigen, von dem, was entschieden wurde. Für das Beispiel könnte es so aussehen:
- Daten und Annahmen: je 10.000 zufällig zugeteilte Nutzer, flacher Prior Beta(1, 1) für beide Varianten, Aufteilung geprüft (kein Sample Ratio Mismatch), Laufzeit zwei volle Wochen.
- Raten: A 4,21 % (95-%-Intervall 3,82–4,61 %), B 4,69 % (4,28–5,11 %).
- Vergleich: Wahrscheinlichkeit, dass B besser ist: 95 %. Relativer Uplift: Median +11 %, 95-%-Intervall −2 % bis +27 %.
- Entscheidung: Der erwartete Verlust bei Wahl von B beträgt 0,006 Prozentpunkte. Liegt die vorab festgelegte Schwelle zum Beispiel bei 0,01 Prozentpunkten, wird B übernommen – mit dem ausdrücklichen Hinweis, dass die Größe des Effekts noch unsicher ist und im Betrieb weiter beobachtet wird.
So sieht jeder, wie sicher das Ergebnis ist, und die Entscheidung bleibt nachvollziehbar, auch wenn sich später herausstellt, dass der Effekt kleiner war als erhofft. Gerade dieser Punkt wird oft unterschätzt: Eine gute Entscheidung unter Unsicherheit kann ein enttäuschendes Ergebnis haben, ohne dadurch falsch gewesen zu sein.
Wann sich ein Bayes-A/B-Test lohnt
Der bayessche Ansatz spielt seine Stärken aus, wenn eine Entscheidung ansteht und deren Risiko greifbar sein soll: Wahrscheinlichkeiten und erwartete Verluste lassen sich direkt mit Kosten, Umsatz oder Aufwand verrechnen. Er erleichtert die Kommunikation, weil die Ergebnisse die Frage beantworten, die gestellt wurde. Und er lässt sich in größere Modelle einbetten, etwa hierarchische Modelle über viele Tests oder Segmente (Gelman et al. 2013).
Wenn es weniger um eine saubere Schlussfolgerung geht als darum, während des Lernens möglichst wenig Ertrag zu verschenken, sind adaptive Verfahren eine Alternative. Wie sie Verkehr laufend zur besseren Variante verschieben, erklärt der Artikel über Multi-Armed Bandits und Thompson Sampling.
Fazit
Ein Bayes A/B-Test ersetzt die Frage „signifikant oder nicht?“ durch drei Größen, die zu einer Entscheidung passen: die Wahrscheinlichkeit, dass B besser ist, den erwarteten Verlust einer Wahl und das Intervall für die Effektgröße. Das ist kein Freibrief für beliebiges Nachschauen und kein Ersatz für Planung – aber eine ehrlichere und direkt nutzbare Darstellung dessen, was die Daten tatsächlich zeigen.
Häufige Fragen
Was ist ein Bayes A/B-Test?
Ein A/B-Test, der für jede Variante eine Posterior-Verteilung der Konversionsrate berechnet – meist mit dem Beta-Binomial-Modell. Statt eines p-Werts liefert er direkte Aussagen wie „B ist mit 95 % Wahrscheinlichkeit besser“, ein Intervall für den Uplift und den erwarteten Verlust, falls man sich für die falsche Variante entscheidet.
Ist P(B > A) = 95 % dasselbe wie „signifikant“?
Nein. Die Wahrscheinlichkeit bezieht sich auf die Hypothese, gegeben Modell, Prior und Daten; der p-Wert auf die Daten unter der Nullhypothese. Mit flachem Prior und großen Stichproben liegt P(B > A) nahe bei eins minus dem einseitigen p-Wert. Ein zweiseitiger Test auf 5-%-Niveau verlangt daher mehr Evidenz als die Schwelle „95 % Wahrscheinlichkeit“.
Darf ich einen Bayes A/B-Test jederzeit beenden?
Der Posterior ist zu jedem Zeitpunkt korrekt berechnet. Wer aber wiederholt nachschaut und bei der ersten günstigen Zahl stoppt, erklärt in Experimenten ohne echten Unterschied deutlich häufiger einen Gewinner. Sinnvoll sind eine vorab festgelegte Laufzeit, geplante Zwischenauswertungen oder eine Stoppregel über den erwarteten Verlust mit Mindestlaufzeit.
Welchen Prior sollte ich für einen A/B-Test verwenden?
Für den Einstieg einen flachen Prior Beta(1, 1) für beide Varianten. Bei viel Verkehr ist sein Einfluss vernachlässigbar. Informative Priors aus früheren Tests sind möglich, sollten aber für beide Varianten gleich sein, damit das Vorwissen keine Variante bevorzugt.
Quellen und weiterführende Literatur
- OnlineMiller, E. (2015): Formulas for Bayesian A/B Testing. evanmiller.org.Herleitung der geschlossenen Formel für P(B > A) im Beta-Binomial-Modell.
- BerichtStucchio, C. (2015): Bayesian A/B Testing at VWO. Whitepaper, Visual Website Optimizer (VWO).Führt den erwarteten Verlust und die „threshold of caring“ als Entscheidungsregel ein.
- PaperKruschke, J. K. (2018): Rejecting or Accepting Parameter Values in Bayesian Estimation. Advances in Methods and Practices in Psychological Science 1(2), 270–280.
- BuchKohavi, R., Tang, D. und Xu, Y. (2020): Trustworthy Online Controlled Experiments: A Practical Guide to A/B Testing. Cambridge University Press.Das Praxis-Standardwerk zu Online-Experimenten, inklusive Stichprobenplanung und Sample Ratio Mismatch.
- PaperRouder, J. N. (2014): Optional stopping: No problem for Bayesians. Psychonomic Bulletin & Review 21(2), 301–308.
- Paperde Heide, R. und Grünwald, P. D. (2021): Why optional stopping can be a problem for Bayesians. Psychonomic Bulletin & Review 28.
- PaperDeng, A., Lu, J. und Chen, S. (2016): Continuous Monitoring of A/B Tests without Pain: Optional Stopping in Bayesian Testing. IEEE International Conference on Data Science and Advanced Analytics (DSAA).
- PaperJohari, R., Koomen, P., Pekelis, L. und Walsh, D. (2017): Peeking at A/B Tests: Why it matters, and what to do about it. Proceedings of the 23rd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining (KDD).
- BuchGelman, A., Carlin, J. B., Stern, H. S., Dunson, D. B., Vehtari, A. und Rubin, D. B. (2013): Bayesian Data Analysis (3. Auflage). CRC Press.
- PaperWasserstein, R. L. und Lazar, N. A. (2016): The ASA Statement on p-Values: Context, Process, and Purpose. The American Statistician 70(2), 129–133.
Zuletzt fachlich geprüft am 25. September 2026. Hinweise auf Fehler nehmen wir gern entgegen: impressum@nyxai.com.