Nachschlagen
Glossar: Statistik, Entscheidung und Lernen von A bis Z
82 Begriffe aus Bayesscher Statistik, Entscheidungstheorie, Simulation, Optimierung und Reinforcement Learning – kurz, präzise und mit Verweisen auf die ausführlichen Artikel.
A
A/B-TestA/B test, online controlled experiment
Randomisiertes Experiment, bei dem Nutzer zufällig auf zwei (oder mehr) Varianten verteilt werden, um den Effekt einer Änderung auf eine Zielgröße zu messen. Durch die Zufallszuteilung lassen sich Unterschiede ursächlich der Variante zuschreiben.
Artikel: Bayes A/B-TestMulti-Armed Bandits & Thompson Sampling Siehe auch: Konversionsrate, Uplift, Multi-Armed Bandit
B
Basisratebase rate
Die Ausgangshäufigkeit eines Merkmals in der betrachteten Population, etwa die Prävalenz einer Krankheit. Wer sie ignoriert, begeht den Basisratenfehler und verwechselt mit .
Artikel: Bayessche Statistik einfach erklärt Siehe auch: Prior
Bellman-GleichungBellman equation
Rekursive Beziehung für Wertfunktionen: Der Wert eines Zustands ist die erwartete sofortige Belohnung plus der abgezinste Wert des Folgezustands. Die Optimalitätsversion mit einem Maximum über die Aktionen charakterisiert die optimale Policy.
Artikel: Reinforcement Learning einfach erklärt Siehe auch: Wertfunktion, Value Iteration
Belohnung (Reward)reward
Zahlenwert, den ein Agent im Reinforcement Learning nach einer Aktion von der Umgebung erhält. Sie ist das einzige Lernsignal; ihre Gestaltung bestimmt, welches Verhalten tatsächlich gelernt wird.
Artikel: Reinforcement Learning einfach erklärt Siehe auch: Diskontfaktor
Beta-Verteilungbeta distribution
Verteilung auf dem Intervall mit Dichte proportional zu . Mittelwert . Sie ist der Standard-Prior für Erfolgsquoten, weil sie zur Binomial-Likelihood konjugiert ist.
Artikel: Bayessche Statistik einfach erklärtBayes A/B-TestMulti-Armed Bandits & Thompson Sampling Siehe auch: Konjugierter Prior
Branch-and-Boundbranch and bound
Lösungsverfahren für ganzzahlige Probleme: Das Problem wird schrittweise in Teilprobleme zerlegt (Branching); Schranken aus Relaxationen erlauben es, Teilbäume auszuschließen, die die beste bekannte Lösung nicht mehr schlagen können (Bounding).
Artikel: Optimierung: lineare Programme und Scheduling Siehe auch: Ganzzahlige Optimierung
Business Intelligencebusiness intelligence
Aufbereitung und Darstellung von Unternehmensdaten in Berichten, Kennzahlen und Dashboards. Sie beschreibt, was passiert ist und wie die Lage aussieht, leitet aber selbst keine Handlung ab.
Artikel: Was ist Decision Intelligence? Siehe auch: Descriptive Analytics, Decision Intelligence
D
Decision Intelligencedecision intelligence
Ansatz, der die Entscheidung selbst zum Gegenstand der Gestaltung macht: Signale, Kontext, Handlungsoptionen, Bewertung, Freigabe und die Rückmeldung aus der beobachteten Wirkung werden zu einem überprüfbaren Prozess verbunden. Methodisch kombiniert er Statistik, Simulation, Optimierung und Lernen aus Feedback.
Artikel: Was ist Decision Intelligence? Siehe auch: Prescriptive Analytics, Entscheidungsqualität, Entscheidungstheorie
Deep Reinforcement Learningdeep reinforcement learning
Reinforcement Learning, bei dem Policy oder Wertfunktion durch tiefe neuronale Netze dargestellt werden. Es erlaubt Lernen aus hochdimensionalen Eingaben wie Bildern, braucht aber meist sehr viele Interaktionen.
Artikel: Reinforcement Learning einfach erklärt Siehe auch: Reinforcement Learning, Q-Learning
Descriptive Analyticsdescriptive analytics
Beschreibende Analyse vergangener und aktueller Daten – Summen, Quoten, Trends, Verteilungen. Sie beantwortet die Frage „Was ist passiert?“ und ist die Grundlage jeder weiteren Analyse.
Artikel: Was ist Decision Intelligence? Siehe auch: Business Intelligence, Predictive Analytics
Diskontfaktordiscount factor
Faktor zwischen 0 und 1, mit dem künftige Belohnungen pro Zeitschritt abgewertet werden. Kleine Werte machen einen Agenten kurzsichtig, Werte nahe 1 weitsichtig.
Artikel: Reinforcement Learning einfach erklärt Siehe auch: Belohnung (Reward)
Dreiecksverteilungtriangular distribution
Stetige Verteilung, festgelegt durch Minimum , wahrscheinlichsten Wert und Maximum , mit dreieckiger Dichte und Mittelwert . Beliebt für Drei-Punkt-Schätzungen in Projekt- und Risikoplanung.
Artikel: Monte-Carlo-Simulation einfach erklärt Siehe auch: Quantil (Perzentil)
Dualitätduality
Zu jedem linearen Programm gehört ein duales Programm, dessen Variablen man als Preise der Ressourcen lesen kann. Bei lösbaren Problemen stimmen die optimalen Zielwerte von primalem und dualem Programm überein (starke Dualität).
Artikel: Optimierung: lineare Programme und Scheduling Siehe auch: Schattenpreis
E
Entscheidungsbaumdecision tree
Grafisches Modell einer mehrstufigen Entscheidung mit Entscheidungsknoten (Quadrate), Zufallsknoten (Kreise) und Ergebnissen an den Enden. Gelöst wird er durch Rückwärtsrechnung: an Zufallsknoten der Erwartungswert (oder Erwartungsnutzen), an Entscheidungsknoten die beste Option.
Artikel: Entscheidungstheorie und Entscheidungsbäume Siehe auch: Wert der Information, Erwartungswert
Entscheidungsqualitätdecision quality
Güte einer Entscheidung, beurteilt nach dem Wissen zum Zeitpunkt der Entscheidung: Wurden relevante Optionen, Unsicherheiten, Bewertungen und Grenzen sauber berücksichtigt? Sie ist vom Ergebnis zu unterscheiden, das auch vom Zufall abhängt; wer beides verwechselt, begeht den Fehlschluss des „Resulting“.
Artikel: Was ist Decision Intelligence?Entscheidungstheorie und Entscheidungsbäume Siehe auch: Entscheidungsregel, Decision Intelligence
Entscheidungsregeldecision rule
Vorab festgelegte Vorschrift, die aus Daten oder Kennzahlen eine Handlung ableitet – etwa „Variante wählen, sobald ihr erwarteter Verlust unter einer Toleranz liegt“. Feste Regeln machen Entscheidungen überprüfbar und schützen vor nachträglicher Rechtfertigung.
Artikel: Was ist Decision Intelligence?Bayes A/B-Test Siehe auch: Erwarteter Verlust, Entscheidungsqualität
Entscheidungstheoriedecision theory
Die Lehre davon, wie man unter Unsicherheit zwischen Handlungen wählt: Handlungen, mögliche Zustände der Welt, Wahrscheinlichkeiten und Bewertungen (Nutzen oder Verlust) werden zu einer begründeten Wahl verbunden – klassisch durch Maximierung des erwarteten Nutzens.
Artikel: Entscheidungstheorie und EntscheidungsbäumeWas ist Decision Intelligence?
Epsilon-greedy (ε-greedy)epsilon-greedy
Einfache Bandit-Strategie: Mit Wahrscheinlichkeit wird die Option mit der bisher besten beobachteten Rate gewählt, mit Wahrscheinlichkeit eine zufällige. Bei festem exploriert sie dauerhaft und ungezielt.
Artikel: Multi-Armed Bandits & Thompson Sampling Siehe auch: Exploration und Exploitation, Thompson Sampling
Ergebnismatrixpayoff table
Tabelle, die für jede Kombination aus Handlung (Zeile) und Umweltzustand (Spalte) das Ergebnis angibt. Sie ist der Ausgangspunkt für Entscheidungsregeln wie Maximin, Minimax-Regret oder den Erwartungswert.
Artikel: Entscheidungstheorie und Entscheidungsbäume Siehe auch: Entscheidungstheorie, Minimax-Regret
Erwarteter Verlustexpected loss
Der Verlust, den man im Mittel in Kauf nimmt, wenn man sich für eine Option entscheidet, obwohl eine andere besser sein könnte. Im A/B-Test: bei Wahl von B. Liegt er unter einer vorab festgelegten Schwelle, ist die Entscheidung vertretbar.
Artikel: Bayes A/B-Test Siehe auch: A/B-Test, Posterior
Erwartungsnutzenexpected utility
Wahrscheinlichkeitsgewichteter Mittelwert des Nutzens der Ergebnisse, . Nach dem Theorem von von Neumann und Morgenstern lässt sich jede Präferenz, die bestimmte Konsistenzaxiome erfüllt, durch Maximierung des Erwartungsnutzens darstellen.
Artikel: Entscheidungstheorie und Entscheidungsbäume Siehe auch: Nutzenfunktion, Erwartungswert
Erwartungswertexpected value
Wahrscheinlichkeitsgewichteter Mittelwert einer Zufallsgröße, . Bei häufig wiederholten Entscheidungen entspricht er dem langfristigen Durchschnitt; über die Streuung der Ergebnisse sagt er nichts.
Artikel: Entscheidungstheorie und Entscheidungsbäume Siehe auch: Erwartungsnutzen
Evidenzmarginal likelihood, evidence
Die Gesamtwahrscheinlichkeit der Daten unter einem Modell, . Im Satz von Bayes ist sie der Normierungsfaktor; beim Vergleich von Modellen (Bayes-Faktor) spielt sie eine eigene Rolle.
Artikel: Bayessche Statistik einfach erklärt Siehe auch: Likelihood
Exploration und Exploitationexploration vs. exploitation
Grundkonflikt lernender Systeme: Exploitation nutzt die nach aktuellem Wissen beste Option, Exploration probiert weniger bekannte Optionen aus, um besseres Wissen zu gewinnen. Zu wenig Exploration übersieht gute Optionen, zu viel verschenkt Ertrag.
Artikel: Multi-Armed Bandits & Thompson SamplingReinforcement Learning einfach erklärt Siehe auch: Multi-Armed Bandit, Thompson Sampling
G
Ganzzahlige Optimierung(mixed-)integer programming, MIP
Optimierung, bei der einige oder alle Variablen ganzzahlig sein müssen, etwa Stückzahlen oder Ja-nein-Entscheidungen. Solche Probleme sind im Allgemeinen NP-schwer; Standardwerkzeug ist Branch-and-Bound mit LP-Relaxationen.
Artikel: Optimierung: lineare Programme und Scheduling Siehe auch: Branch-and-Bound, NP-schwer
Gesetz der großen Zahlenlaw of large numbers
Satz der Wahrscheinlichkeitstheorie: Der Mittelwert unabhängiger, identisch verteilter Zufallsgrößen strebt mit wachsender Stichprobengröße gegen ihren Erwartungswert. Er begründet, warum Monte-Carlo-Schätzungen mit mehr Durchläufen genauer werden.
Artikel: Monte-Carlo-Simulation einfach erklärt Siehe auch: Zentraler Grenzwertsatz
Governancegovernance
Regeln, Rollen und Kontrollen, die festlegen, wer ein Entscheidungssystem verantwortet, wer Empfehlungen freigibt, wie Risiken gemessen werden und wie sich Entscheidungen nachvollziehen lassen. Rahmenwerke wie das NIST AI Risk Management Framework strukturieren diese Aufgaben.
Artikel: Was ist Decision Intelligence? Siehe auch: Human-in-the-Loop
H
Heuristikheuristic
Lösungsverfahren, das in vertretbarer Zeit gute, aber nicht nachweislich optimale Lösungen liefert, etwa Prioritätsregeln, lokale Suche oder Simulated Annealing. Schranken aus exakten Verfahren zeigen, wie weit eine heuristische Lösung höchstens vom Optimum entfernt ist.
Artikel: Optimierung: lineare Programme und Scheduling Siehe auch: Scheduling
Human-in-the-Loophuman in the loop
Gestaltungsprinzip, bei dem ein Mensch die Empfehlung eines Systems prüft, freigibt oder korrigiert, bevor sie wirksam wird. Es ordnet Verantwortung eindeutig zu und setzt voraus, dass die Empfehlung ihre Annahmen erkennen lässt.
Artikel: Was ist Decision Intelligence? Siehe auch: Governance
K
Kalibrierungcalibration
Eigenschaft probabilistischer Prognosen und Schätzungen, dass angegebene Wahrscheinlichkeiten mit beobachteten Häufigkeiten übereinstimmen: Von allen 80-%-Intervallen sollten auf Dauer etwa 80 % den tatsächlichen Wert enthalten. Liegt der Anteil deutlich darunter, sind die Prognosen zu selbstsicher.
Artikel: Was ist Decision Intelligence? Siehe auch: Prognoseintervall
Konjugierter Priorconjugate prior
Ein Prior, dessen Posterior zur selben Verteilungsfamilie gehört. Beispiel: Beta-Prior und Binomial-Likelihood ergeben den Posterior . Konjugierte Paare erlauben Updates ohne numerische Integration.
Artikel: Bayessche Statistik einfach erklärt Siehe auch: Beta-Verteilung
Kontextueller Banditcontextual bandit
Erweiterung des Multi-Armed Bandit, bei der vor jeder Wahl ein Kontext beobachtet wird, etwa Gerät, Tageszeit oder Interessen. Gelernt wird, welche Option in welchem Kontext am besten ist; ein bekanntes Verfahren ist LinUCB.
Artikel: Multi-Armed Bandits & Thompson Sampling Siehe auch: Multi-Armed Bandit
Konversionsrateconversion rate
Anteil der Besucher oder Nutzer, die eine gewünschte Handlung ausführen, etwa einen Kauf oder eine Anmeldung: Konversionen geteilt durch Besucher. Im Bayes A/B-Test wird sie pro Variante mit einer Beta-Verteilung beschrieben.
Artikel: Bayes A/B-Test Siehe auch: A/B-Test, Beta-Verteilung
Kredibilitätsintervallcredible interval
Intervall, das den Parameter mit einer vorgegebenen Posterior-Wahrscheinlichkeit enthält, etwa 95 %. Üblich sind das zentrale Intervall zwischen dem 2,5-%- und 97,5-%-Quantil und das Intervall höchster Dichte (HDI). Anders als ein Konfidenzintervall ist es eine direkte Wahrscheinlichkeitsaussage – gegeben Modell und Prior.
Artikel: Bayessche Statistik einfach erklärtBayes A/B-Test Siehe auch: Posterior, p-Wert
L
Likelihoodlikelihood
Wahrscheinlichkeit (bzw. Dichte) der beobachteten Daten als Funktion des Parameters, . Bei festen Daten zeigt sie, wie gut jeder Parameterwert die Beobachtungen erklärt; über integriert ergibt sie im Allgemeinen nicht 1.
Artikel: Bayessche Statistik einfach erklärt Siehe auch: Prior, Posterior
Lineare Optimierunglinear programming (LP)
Optimierung einer linearen Zielfunktion unter linearen Gleichungen und Ungleichungen, etwa unter , . Ist das Problem lösbar und beschränkt, liegt ein Optimum in einer Ecke des zulässigen Bereichs.
Artikel: Optimierung: lineare Programme und Scheduling Siehe auch: Zielfunktion, Nebenbedingung, Simplex-Verfahren
M
MAP-Schätzermaximum a posteriori estimate
Der Modus des Posteriors, also der Parameterwert mit der höchsten Posterior-Dichte. Bei flachem Prior stimmt er mit dem Maximum-Likelihood-Schätzer überein.
Artikel: Bayessche Statistik einfach erklärt Siehe auch: Posterior
Markov-Chain-Monte-CarloMarkov chain Monte Carlo (MCMC)
Familie von Simulationsverfahren, die eine Markov-Kette mit dem Posterior als Grenzverteilung erzeugen. Die Häufigkeiten der Kettenwerte approximieren den Posterior. Bekannte Vertreter: Metropolis-Hastings, Gibbs-Sampling, Hamiltonian Monte Carlo (NUTS).
Artikel: Bayessche Statistik einfach erklärtMonte-Carlo-Simulation einfach erklärt Siehe auch: Posterior
Markov-EntscheidungsprozessMarkov decision process (MDP)
Mathematisches Modell für Entscheidungen über mehrere Schritte: Zustände, Aktionen, Übergangswahrscheinlichkeiten , Belohnungen und ein Diskontfaktor. Die Markov-Eigenschaft besagt, dass der aktuelle Zustand alle für die Zukunft relevanten Informationen enthält.
Artikel: Reinforcement Learning einfach erklärt Siehe auch: Belohnung (Reward), Diskontfaktor, Policy
Minimax-Regretminimax regret
Entscheidungsregel für Situationen ohne Wahrscheinlichkeiten: Für jeden Zustand misst man das Bedauern (Regret) als Abstand zum besten Ergebnis in diesem Zustand und wählt die Handlung, deren größtes Bedauern am kleinsten ist.
Artikel: Entscheidungstheorie und Entscheidungsbäume Siehe auch: Ergebnismatrix
Monte-Carlo-SimulationMonte Carlo simulation
Verfahren, das eine unsichere Größe schätzt, indem es ein Modell sehr oft mit zufällig gezogenen Eingaben durchrechnet und die Ergebnisse statistisch auswertet. Der Schätzfehler sinkt proportional zu , wobei die Zahl der Durchläufe ist.
Artikel: Monte-Carlo-Simulation einfach erklärt Siehe auch: Standardfehler, Varianzreduktion, Markov-Chain-Monte-Carlo
Multi-Armed Banditmulti-armed bandit
Entscheidungsproblem, bei dem man wiederholt eine von mehreren Optionen („Armen“) mit unbekannter Erfolgsrate wählt und nur das Ergebnis der gewählten Option beobachtet. Ziel ist, die Summe der Belohnungen zu maximieren – man muss zugleich lernen und nutzen.
Artikel: Multi-Armed Bandits & Thompson Sampling Siehe auch: Regret, Exploration und Exploitation, Thompson Sampling
N
Nebenbedingungconstraint
Bedingung, die eine zulässige Lösung erfüllen muss, etwa eine Kapazitätsgrenze oder eine Mindestmenge. Harte Nebenbedingungen dürfen nie verletzt werden; weiche werden über Strafterme in der Zielfunktion abgewogen.
Artikel: Optimierung: lineare Programme und Scheduling Siehe auch: Zielfunktion, Zulässiger Bereich
NP-schwerNP-hard
Klasse von Problemen, für die kein Algorithmus bekannt ist, der jede Instanz in polynomieller Zeit exakt löst. Für große Instanzen setzt man deshalb auf problemspezifische exakte Verfahren mit Schranken oder auf Heuristiken.
Artikel: Optimierung: lineare Programme und Scheduling Siehe auch: Heuristik, Ganzzahlige Optimierung
Nutzenfunktionutility function
Funktion , die Ergebnissen (etwa Geldbeträgen) einen Nutzenwert zuordnet. Ihre Krümmung bildet die Risikoeinstellung ab: konkav bei Risikoaversion, linear bei Risikoneutralität, konvex bei Risikofreude.
Artikel: Entscheidungstheorie und Entscheidungsbäume Siehe auch: Risikoaversion, Erwartungsnutzen
O
Optional Stoppingoptional stopping, peeking
Das Beenden eines Experiments abhängig von den bisherigen Ergebnissen, etwa sobald eine Kennzahl eine Schwelle überschreitet. Der bayessche Posterior bleibt dabei korrekt berechnet; die Fehlerraten einer Entscheidungsregel über viele Experimente verändern sich jedoch, wenn man wiederholt nachschaut.
Artikel: Bayes A/B-Test Siehe auch: A/B-Test, p-Wert
P
p-Wertp-value
Die Wahrscheinlichkeit, unter der Nullhypothese ein mindestens so extremes Ergebnis zu beobachten wie das tatsächlich beobachtete. Er ist nicht die Wahrscheinlichkeit, dass die Nullhypothese stimmt, und kein Maß für die Größe eines Effekts.
Artikel: Bayessche Statistik einfach erklärtBayes A/B-Test Siehe auch: Kredibilitätsintervall
Parameterparameter
Unbekannte Größe eines statistischen Modells, zum Beispiel eine Erfolgsquote oder ein Mittelwert . In der bayesschen Statistik wird ein Parameter durch eine Wahrscheinlichkeitsverteilung beschrieben.
Artikel: Bayessche Statistik einfach erklärt
Policypolicy
Die Strategie eines Agenten: eine Vorschrift , die jedem Zustand eine Aktion oder eine Wahrscheinlichkeitsverteilung über Aktionen zuordnet.
Artikel: Reinforcement Learning einfach erklärt Siehe auch: Wertfunktion
Posteriorposterior distribution
Verteilung eines Parameters nach Berücksichtigung der Daten: proportional zu Likelihood mal Prior, . Aus ihr lassen sich Punktschätzer, Kredibilitätsintervalle und Wahrscheinlichkeiten für Aussagen ablesen.
Artikel: Bayessche Statistik einfach erklärtBayes A/B-Test Siehe auch: Prior, Likelihood, Kredibilitätsintervall
Posterior-Predictive-Verteilungposterior predictive distribution
Verteilung zukünftiger Beobachtungen, gemittelt über alle plausiblen Parameterwerte: . Sie dient für Vorhersagen und für Modellprüfungen (Posterior-Predictive-Checks).
Artikel: Bayessche Statistik einfach erklärt
Predictive Analyticspredictive analytics
Schätzt mit statistischen Modellen oder maschinellem Lernen, was unter bestimmten Annahmen wahrscheinlich eintreten wird. Für Entscheidungen ist eine Prognose als Verteilung mit Prognoseintervall wertvoller als eine einzelne Zahl.
Artikel: Was ist Decision Intelligence? Siehe auch: Prognoseintervall, Prescriptive Analytics
Prescriptive Analyticsprescriptive analytics
Leitet aus Prognosen, Zielen und Nebenbedingungen Handlungsempfehlungen ab, typischerweise mit Optimierung, Simulation oder Entscheidungsregeln. Sie setzt ausdrücklich formulierte Ziele und Grenzen voraus.
Artikel: Was ist Decision Intelligence?Optimierung: lineare Programme und Scheduling Siehe auch: Decision Intelligence, Entscheidungsregel
Priorprior distribution
Wahrscheinlichkeitsverteilung, die beschreibt, welche Werte eines unbekannten Parameters vor dem Blick auf die Daten plausibel sind. Sie kann flach, schwach informativ oder informativ sein und sollte begründet und dokumentiert werden.
Artikel: Bayessche Statistik einfach erklärt Siehe auch: Posterior, Konjugierter Prior
Prognoseintervallprediction interval
Intervall, in das eine zukünftige Beobachtung mit vorgegebener Wahrscheinlichkeit fällt, etwa 80 %. Anders als ein Konfidenz- oder Kredibilitätsintervall für einen Parameter bezieht es sich auf einen künftigen Einzelwert und ist deshalb breiter.
Artikel: Was ist Decision Intelligence? Siehe auch: Kalibrierung, Kredibilitätsintervall
Pseudozufallszahlenpseudo-random numbers
Zahlenfolgen, die ein deterministischer Algorithmus erzeugt und die statistisch wie Zufall wirken. Mit demselben Startwert (Seed) entsteht dieselbe Folge – das macht Simulationen reproduzierbar und prüfbar.
Q
Q-LearningQ-learning
Modellfreies Verfahren des Reinforcement Learning, das Aktionswerte aus Erfahrung lernt: . Es lernt die Werte der optimalen Policy, auch während der Agent erkundet (Off-Policy-Lernen).
Artikel: Reinforcement Learning einfach erklärt Siehe auch: Temporal-Difference-Lernen, Bellman-Gleichung
Quantil (Perzentil)quantile, percentile
Der Wert, unter dem ein bestimmter Anteil einer Verteilung liegt. Das 90-%-Quantil, kurz P90, wird in 90 % der Fälle nicht überschritten; der Median ist das 50-%-Quantil.
Artikel: Monte-Carlo-Simulation einfach erklärt Siehe auch: Dreiecksverteilung
R
Regretregret
Differenz zwischen der erwarteten Belohnung, die man mit der besten Option erzielt hätte, und der tatsächlich erzielten: . Der Regret misst die Kosten des Lernens; gute Bandit-Algorithmen lassen ihn nur logarithmisch wachsen.
Artikel: Multi-Armed Bandits & Thompson Sampling Siehe auch: Multi-Armed Bandit
Reinforcement Learningreinforcement learning
Teilgebiet des maschinellen Lernens, in dem ein Agent durch Interaktion mit einer Umgebung lernt, Aktionen so zu wählen, dass die langfristige, meist abgezinste Summe der Belohnungen möglichst groß wird. Auf Deutsch auch bestärkendes Lernen.
Artikel: Reinforcement Learning einfach erklärt Siehe auch: Markov-Entscheidungsprozess, Q-Learning
Risikoaversionrisk aversion
Eigenschaft eines Entscheiders, der einen sicheren Betrag einer Lotterie mit gleichem Erwartungswert vorzieht. Formal gehört dazu eine konkave Nutzenfunktion; das Sicherheitsäquivalent liegt dann unter dem Erwartungswert.
Artikel: Entscheidungstheorie und Entscheidungsbäume Siehe auch: Sicherheitsäquivalent, Nutzenfunktion
ROPEregion of practical equivalence
Region praktischer Äquivalenz: ein vorab festgelegter Bereich von Effektgrößen, die als praktisch gleichwertig mit null gelten. Liegt das Intervall höchster Posterior-Dichte ganz außerhalb, gilt ein Effekt als relevant; liegt es ganz innerhalb, als vernachlässigbar.
Artikel: Bayes A/B-Test Siehe auch: Kredibilitätsintervall
S
Sample Ratio Mismatchsample ratio mismatch (SRM)
Deutliche Abweichung der tatsächlichen Aufteilung der Nutzer von der geplanten, etwa 50,8 zu 49,2 statt 50 zu 50 bei großen Stichproben. Meist ein Hinweis auf technische Fehler bei Zuteilung oder Messung; die Testergebnisse sind dann nicht vertrauenswürdig.
Artikel: Bayes A/B-Test Siehe auch: A/B-Test
Schattenpreisshadow price, dual value
Verbesserung des optimalen Zielwerts pro zusätzlicher Einheit einer knappen Ressource, also der Wert der zugehörigen Dualvariable. Er gilt nur in einem Bereich, in dem dieselben Nebenbedingungen bindend bleiben; nicht ausgeschöpfte Ressourcen haben den Schattenpreis null.
Artikel: Optimierung: lineare Programme und Scheduling Siehe auch: Dualität
Schedulingscheduling
Planung, welche Aufgaben wann auf welchen Ressourcen bearbeitet werden, unter Zielen wie kurzer Durchlaufzeit oder geringer Verspätung. Schon einfache Varianten wie das Job-Shop-Problem sind NP-schwer.
Artikel: Optimierung: lineare Programme und Scheduling Siehe auch: NP-schwer, Heuristik
Sensitivitätsanalysesensitivity analysis
Untersuchung, wie stark ein Modellergebnis auf Änderungen einzelner Eingaben oder Annahmen reagiert. Varianzbasierte Varianten messen, welcher Anteil der Streuung des Ergebnisses auf welche Eingabe zurückgeht.
Artikel: Monte-Carlo-Simulation einfach erklärt Siehe auch: Monte-Carlo-Simulation
Shrinkageshrinkage
Das Zusammenziehen einer Schätzung in Richtung einer Vorannahme oder eines Gesamtmittels. Im Beta-Binomial-Modell ist der Posterior-Mittelwert ein gewichteter Durchschnitt aus Prior-Mittelwert und beobachteter Quote; das schützt kleine Stichproben vor extremen Schätzungen.
Artikel: Bayessche Statistik einfach erklärt
Sicherheitsäquivalentcertainty equivalent
Der sichere Betrag, den ein Entscheider als gleichwertig zu einer riskanten Alternative ansieht: . Die Differenz zwischen Erwartungswert und Sicherheitsäquivalent heißt Risikoprämie.
Artikel: Entscheidungstheorie und Entscheidungsbäume Siehe auch: Risikoaversion
Simplex-Verfahrensimplex method
Von George B. Dantzig entwickeltes Verfahren für lineare Programme, das von Ecke zu benachbarter Ecke des zulässigen Bereichs wandert und dabei den Zielwert nie verschlechtert. Im ungünstigsten Fall exponentiell, in der Praxis meist sehr schnell.
Artikel: Optimierung: lineare Programme und Scheduling Siehe auch: Lineare Optimierung
Standardfehlerstandard error
Standardabweichung eines Schätzers über gedachte Wiederholungen der Stichprobe oder Simulation. Für einen Mittelwert aus unabhängigen Werten beträgt er ; rund 95 % der Schätzungen liegen innerhalb von zwei Standardfehlern um den wahren Wert.
Artikel: Monte-Carlo-Simulation einfach erklärt Siehe auch: Zentraler Grenzwertsatz
Szenarioscenario
Eine in sich stimmige Annahme über die Zukunft – etwa über Nachfrage, Preise oder Ausfälle –, unter der Handlungsoptionen durchgerechnet werden. Eine Monte-Carlo-Simulation erzeugt viele Szenarien aus Wahrscheinlichkeitsverteilungen und zeigt so die Bandbreite möglicher Ergebnisse.
Artikel: Was ist Decision Intelligence?Monte-Carlo-Simulation einfach erklärt Siehe auch: Prognoseintervall
T
Temporal-Difference-Lernentemporal-difference learning
Familie von Lernverfahren, die Wertschätzungen nach jedem Schritt in Richtung eines Ziels aus beobachteter Belohnung und geschätztem Folgewert verschieben. Die Differenz zwischen Ziel und bisheriger Schätzung heißt TD-Fehler.
Artikel: Reinforcement Learning einfach erklärt Siehe auch: Q-Learning
Thompson SamplingThompson sampling, probability matching
Strategie für Bandit-Probleme: Man zieht aus dem Posterior jeder Option einen Zufallswert und wählt die Option mit dem größten Wert. Dadurch wird jede Option genau mit der Wahrscheinlichkeit gewählt, mit der sie nach aktuellem Wissen die beste ist.
Artikel: Multi-Armed Bandits & Thompson Sampling Siehe auch: Multi-Armed Bandit, Posterior, UCB (Upper Confidence Bound)
U
UCB (Upper Confidence Bound)upper confidence bound
Familie von Bandit-Strategien nach dem Prinzip „Optimismus bei Unsicherheit“: Jede Option wird nach einer oberen Vertrauensgrenze ihrer Rate bewertet. UCB1 wählt den Arm mit dem größten Wert ; selten gespielte Arme erhalten so einen Bonus.
Artikel: Multi-Armed Bandits & Thompson Sampling Siehe auch: Thompson Sampling, Epsilon-greedy (ε-greedy)
Upliftuplift, relative lift
Relative Verbesserung einer Variante gegenüber der Kontrolle, meist . Neben dem Punktwert gehört immer ein Intervall dazu, denn gerade bei kleinen Effekten ist die Unsicherheit über die Größe oft erheblich.
Artikel: Bayes A/B-Test Siehe auch: A/B-Test, Kredibilitätsintervall
V
Value Iterationvalue iteration
Verfahren der dynamischen Programmierung, das die Bellman-Optimalitätsgleichung wiederholt als Aktualisierungsvorschrift anwendet, bis sich die Werte nicht mehr ändern. Es setzt bekannte Übergänge und Belohnungen voraus.
Artikel: Reinforcement Learning einfach erklärt Siehe auch: Bellman-Gleichung, Q-Learning
Varianzreduktionvariance reduction
Techniken, die die Streuung einer Monte-Carlo-Schätzung bei gleicher Zahl von Durchläufen verringern, etwa antithetische Variablen, gemeinsame Zufallszahlen, Kontrollvariablen oder Importance Sampling.
Artikel: Monte-Carlo-Simulation einfach erklärt Siehe auch: Monte-Carlo-Simulation, Standardfehler
W
Wert der Informationvalue of information (EVPI, EVSI)
Um wie viel sich der beste erreichbare Erwartungswert verbessert, wenn man vor der Entscheidung zusätzliche Information erhält. Der Wert vollkommener Information (EVPI) ist die Obergrenze für jede Studie; der Wert einer konkreten Stichprobe oder eines Tests heißt EVSI.
Artikel: Entscheidungstheorie und Entscheidungsbäume Siehe auch: Entscheidungsbaum
Wertfunktionvalue function
Erwarteter künftiger Return, wenn man in einem Zustand startet (Zustandswert ) oder dort zuerst eine bestimmte Aktion wählt (Aktionswert ) und danach der Policy folgt.
Artikel: Reinforcement Learning einfach erklärt Siehe auch: Bellman-Gleichung, Policy
Z
Zentraler Grenzwertsatzcentral limit theorem
Satz der Wahrscheinlichkeitstheorie: Die geeignet standardisierte Summe vieler unabhängiger Zufallsgrößen mit endlicher Varianz ist näherungsweise normalverteilt. Daraus folgt, dass der Fehler eines Mittelwerts ungefähr normalverteilt ist, mit Standardabweichung .
Artikel: Monte-Carlo-Simulation einfach erklärt Siehe auch: Gesetz der großen Zahlen, Standardfehler
Zielfunktionobjective function
Die Größe, die ein Optimierungsmodell maximiert oder minimiert, zum Beispiel Deckungsbeitrag, Kosten oder Verspätung. Welche Lösung „optimal“ ist, hängt vollständig von ihrer Formulierung ab.
Artikel: Optimierung: lineare Programme und Scheduling Siehe auch: Nebenbedingung
Zulässiger Bereichfeasible region
Menge aller Lösungen, die sämtliche Nebenbedingungen erfüllen. Bei einem linearen Programm ist er ein konvexes Polyeder; ist er leer, heißt das Problem unzulässig.
Artikel: Optimierung: lineare Programme und Scheduling Siehe auch: Nebenbedingung, Lineare Optimierung