Nachschlagen

Glossar: Statistik, Entscheidung und Lernen von A bis Z

82 Begriffe aus Bayesscher Statistik, Entscheidungstheorie, Simulation, Optimierung und Reinforcement Learning – kurz, präzise und mit Verweisen auf die ausführlichen Artikel.

A

A/B-TestA/B test, online controlled experiment

Randomisiertes Experiment, bei dem Nutzer zufällig auf zwei (oder mehr) Varianten verteilt werden, um den Effekt einer Änderung auf eine Zielgröße zu messen. Durch die Zufallszuteilung lassen sich Unterschiede ursächlich der Variante zuschreiben.

B

Basisratebase rate

Die Ausgangshäufigkeit eines Merkmals in der betrachteten Population, etwa die Prävalenz einer Krankheit. Wer sie ignoriert, begeht den Basisratenfehler und verwechselt P(A∣B)P(A \mid B) mit P(B∣A)P(B \mid A).

Bellman-GleichungBellman equation

Rekursive Beziehung für Wertfunktionen: Der Wert eines Zustands ist die erwartete sofortige Belohnung plus der abgezinste Wert des Folgezustands. Die Optimalitätsversion mit einem Maximum über die Aktionen charakterisiert die optimale Policy.

Belohnung (Reward)reward

Zahlenwert, den ein Agent im Reinforcement Learning nach einer Aktion von der Umgebung erhält. Sie ist das einzige Lernsignal; ihre Gestaltung bestimmt, welches Verhalten tatsächlich gelernt wird.

Beta-Verteilungbeta distribution

Verteilung auf dem Intervall [0,1][0, 1] mit Dichte proportional zu θα−1(1−θ)β−1\theta^{\alpha-1}(1-\theta)^{\beta-1}. Mittelwert α/(α+β)\alpha/(\alpha+\beta). Sie ist der Standard-Prior für Erfolgsquoten, weil sie zur Binomial-Likelihood konjugiert ist.

Branch-and-Boundbranch and bound

Lösungsverfahren für ganzzahlige Probleme: Das Problem wird schrittweise in Teilprobleme zerlegt (Branching); Schranken aus Relaxationen erlauben es, Teilbäume auszuschließen, die die beste bekannte Lösung nicht mehr schlagen können (Bounding).

Business Intelligencebusiness intelligence

Aufbereitung und Darstellung von Unternehmensdaten in Berichten, Kennzahlen und Dashboards. Sie beschreibt, was passiert ist und wie die Lage aussieht, leitet aber selbst keine Handlung ab.

D

Decision Intelligencedecision intelligence

Ansatz, der die Entscheidung selbst zum Gegenstand der Gestaltung macht: Signale, Kontext, Handlungsoptionen, Bewertung, Freigabe und die Rückmeldung aus der beobachteten Wirkung werden zu einem überprüfbaren Prozess verbunden. Methodisch kombiniert er Statistik, Simulation, Optimierung und Lernen aus Feedback.

Deep Reinforcement Learningdeep reinforcement learning

Reinforcement Learning, bei dem Policy oder Wertfunktion durch tiefe neuronale Netze dargestellt werden. Es erlaubt Lernen aus hochdimensionalen Eingaben wie Bildern, braucht aber meist sehr viele Interaktionen.

Descriptive Analyticsdescriptive analytics

Beschreibende Analyse vergangener und aktueller Daten – Summen, Quoten, Trends, Verteilungen. Sie beantwortet die Frage „Was ist passiert?“ und ist die Grundlage jeder weiteren Analyse.

Diskontfaktordiscount factor

Faktor γ\gamma zwischen 0 und 1, mit dem künftige Belohnungen pro Zeitschritt abgewertet werden. Kleine Werte machen einen Agenten kurzsichtig, Werte nahe 1 weitsichtig.

Dreiecksverteilungtriangular distribution

Stetige Verteilung, festgelegt durch Minimum aa, wahrscheinlichsten Wert bb und Maximum cc, mit dreieckiger Dichte und Mittelwert (a+b+c)/3(a+b+c)/3. Beliebt für Drei-Punkt-Schätzungen in Projekt- und Risikoplanung.

Dualitätduality

Zu jedem linearen Programm gehört ein duales Programm, dessen Variablen man als Preise der Ressourcen lesen kann. Bei lösbaren Problemen stimmen die optimalen Zielwerte von primalem und dualem Programm überein (starke Dualität).

E

Entscheidungsbaumdecision tree

Grafisches Modell einer mehrstufigen Entscheidung mit Entscheidungsknoten (Quadrate), Zufallsknoten (Kreise) und Ergebnissen an den Enden. Gelöst wird er durch Rückwärtsrechnung: an Zufallsknoten der Erwartungswert (oder Erwartungsnutzen), an Entscheidungsknoten die beste Option.

Entscheidungsqualitätdecision quality

Güte einer Entscheidung, beurteilt nach dem Wissen zum Zeitpunkt der Entscheidung: Wurden relevante Optionen, Unsicherheiten, Bewertungen und Grenzen sauber berücksichtigt? Sie ist vom Ergebnis zu unterscheiden, das auch vom Zufall abhängt; wer beides verwechselt, begeht den Fehlschluss des „Resulting“.

Entscheidungsregeldecision rule

Vorab festgelegte Vorschrift, die aus Daten oder Kennzahlen eine Handlung ableitet – etwa „Variante wählen, sobald ihr erwarteter Verlust unter einer Toleranz liegt“. Feste Regeln machen Entscheidungen überprüfbar und schützen vor nachträglicher Rechtfertigung.

Entscheidungstheoriedecision theory

Die Lehre davon, wie man unter Unsicherheit zwischen Handlungen wählt: Handlungen, mögliche Zustände der Welt, Wahrscheinlichkeiten und Bewertungen (Nutzen oder Verlust) werden zu einer begründeten Wahl verbunden – klassisch durch Maximierung des erwarteten Nutzens.

Epsilon-greedy (ε-greedy)epsilon-greedy

Einfache Bandit-Strategie: Mit Wahrscheinlichkeit 1−ε1-\varepsilon wird die Option mit der bisher besten beobachteten Rate gewählt, mit Wahrscheinlichkeit ε\varepsilon eine zufällige. Bei festem ε\varepsilon exploriert sie dauerhaft und ungezielt.

Ergebnismatrixpayoff table

Tabelle, die für jede Kombination aus Handlung (Zeile) und Umweltzustand (Spalte) das Ergebnis angibt. Sie ist der Ausgangspunkt für Entscheidungsregeln wie Maximin, Minimax-Regret oder den Erwartungswert.

Erwarteter Verlustexpected loss

Der Verlust, den man im Mittel in Kauf nimmt, wenn man sich für eine Option entscheidet, obwohl eine andere besser sein könnte. Im A/B-Test: E[max⁡(pA−pB,0)]\mathbb{E}[\max(p_A - p_B, 0)] bei Wahl von B. Liegt er unter einer vorab festgelegten Schwelle, ist die Entscheidung vertretbar.

Erwartungsnutzenexpected utility

Wahrscheinlichkeitsgewichteter Mittelwert des Nutzens der Ergebnisse, ∑ipi u(xi)\sum_i p_i\,u(x_i). Nach dem Theorem von von Neumann und Morgenstern lässt sich jede Präferenz, die bestimmte Konsistenzaxiome erfüllt, durch Maximierung des Erwartungsnutzens darstellen.

Erwartungswertexpected value

Wahrscheinlichkeitsgewichteter Mittelwert einer Zufallsgröße, E[X]=∑ipi xi\mathbb{E}[X] = \sum_i p_i\,x_i. Bei häufig wiederholten Entscheidungen entspricht er dem langfristigen Durchschnitt; über die Streuung der Ergebnisse sagt er nichts.

Evidenzmarginal likelihood, evidence

Die Gesamtwahrscheinlichkeit der Daten unter einem Modell, p(y)=∫p(y∣θ) p(θ) dθp(y) = \int p(y \mid \theta)\,p(\theta)\,\mathrm{d}\theta. Im Satz von Bayes ist sie der Normierungsfaktor; beim Vergleich von Modellen (Bayes-Faktor) spielt sie eine eigene Rolle.

Exploration und Exploitationexploration vs. exploitation

Grundkonflikt lernender Systeme: Exploitation nutzt die nach aktuellem Wissen beste Option, Exploration probiert weniger bekannte Optionen aus, um besseres Wissen zu gewinnen. Zu wenig Exploration übersieht gute Optionen, zu viel verschenkt Ertrag.

G

Ganzzahlige Optimierung(mixed-)integer programming, MIP

Optimierung, bei der einige oder alle Variablen ganzzahlig sein müssen, etwa Stückzahlen oder Ja-nein-Entscheidungen. Solche Probleme sind im Allgemeinen NP-schwer; Standardwerkzeug ist Branch-and-Bound mit LP-Relaxationen.

Gesetz der großen Zahlenlaw of large numbers

Satz der Wahrscheinlichkeitstheorie: Der Mittelwert unabhängiger, identisch verteilter Zufallsgrößen strebt mit wachsender Stichprobengröße gegen ihren Erwartungswert. Er begründet, warum Monte-Carlo-Schätzungen mit mehr Durchläufen genauer werden.

Governancegovernance

Regeln, Rollen und Kontrollen, die festlegen, wer ein Entscheidungssystem verantwortet, wer Empfehlungen freigibt, wie Risiken gemessen werden und wie sich Entscheidungen nachvollziehen lassen. Rahmenwerke wie das NIST AI Risk Management Framework strukturieren diese Aufgaben.

H

Heuristikheuristic

Lösungsverfahren, das in vertretbarer Zeit gute, aber nicht nachweislich optimale Lösungen liefert, etwa Prioritätsregeln, lokale Suche oder Simulated Annealing. Schranken aus exakten Verfahren zeigen, wie weit eine heuristische Lösung höchstens vom Optimum entfernt ist.

Human-in-the-Loophuman in the loop

Gestaltungsprinzip, bei dem ein Mensch die Empfehlung eines Systems prüft, freigibt oder korrigiert, bevor sie wirksam wird. Es ordnet Verantwortung eindeutig zu und setzt voraus, dass die Empfehlung ihre Annahmen erkennen lässt.

K

Kalibrierungcalibration

Eigenschaft probabilistischer Prognosen und Schätzungen, dass angegebene Wahrscheinlichkeiten mit beobachteten Häufigkeiten übereinstimmen: Von allen 80-%-Intervallen sollten auf Dauer etwa 80 % den tatsächlichen Wert enthalten. Liegt der Anteil deutlich darunter, sind die Prognosen zu selbstsicher.

Konjugierter Priorconjugate prior

Ein Prior, dessen Posterior zur selben Verteilungsfamilie gehört. Beispiel: Beta-Prior und Binomial-Likelihood ergeben den Posterior Beta⁡(α+k,β+n−k)\operatorname{Beta}(\alpha+k, \beta+n-k). Konjugierte Paare erlauben Updates ohne numerische Integration.

Kontextueller Banditcontextual bandit

Erweiterung des Multi-Armed Bandit, bei der vor jeder Wahl ein Kontext beobachtet wird, etwa Gerät, Tageszeit oder Interessen. Gelernt wird, welche Option in welchem Kontext am besten ist; ein bekanntes Verfahren ist LinUCB.

Konversionsrateconversion rate

Anteil der Besucher oder Nutzer, die eine gewünschte Handlung ausführen, etwa einen Kauf oder eine Anmeldung: Konversionen geteilt durch Besucher. Im Bayes A/B-Test wird sie pro Variante mit einer Beta-Verteilung beschrieben.

Kredibilitätsintervallcredible interval

Intervall, das den Parameter mit einer vorgegebenen Posterior-Wahrscheinlichkeit enthält, etwa 95 %. Üblich sind das zentrale Intervall zwischen dem 2,5-%- und 97,5-%-Quantil und das Intervall höchster Dichte (HDI). Anders als ein Konfidenzintervall ist es eine direkte Wahrscheinlichkeitsaussage – gegeben Modell und Prior.

L

Likelihoodlikelihood

Wahrscheinlichkeit (bzw. Dichte) der beobachteten Daten als Funktion des Parameters, p(y∣θ)p(y \mid \theta). Bei festen Daten zeigt sie, wie gut jeder Parameterwert die Beobachtungen erklärt; über θ\theta integriert ergibt sie im Allgemeinen nicht 1.

Lineare Optimierunglinear programming (LP)

Optimierung einer linearen Zielfunktion unter linearen Gleichungen und Ungleichungen, etwa max⁡ c⊤x\max\, c^\top x unter Ax≤bAx \le b, x≥0x \ge 0. Ist das Problem lösbar und beschränkt, liegt ein Optimum in einer Ecke des zulässigen Bereichs.

M

MAP-Schätzermaximum a posteriori estimate

Der Modus des Posteriors, also der Parameterwert mit der höchsten Posterior-Dichte. Bei flachem Prior stimmt er mit dem Maximum-Likelihood-Schätzer überein.

Markov-Chain-Monte-CarloMarkov chain Monte Carlo (MCMC)

Familie von Simulationsverfahren, die eine Markov-Kette mit dem Posterior als Grenzverteilung erzeugen. Die Häufigkeiten der Kettenwerte approximieren den Posterior. Bekannte Vertreter: Metropolis-Hastings, Gibbs-Sampling, Hamiltonian Monte Carlo (NUTS).

Markov-EntscheidungsprozessMarkov decision process (MDP)

Mathematisches Modell für Entscheidungen über mehrere Schritte: Zustände, Aktionen, Übergangswahrscheinlichkeiten P(s′∣s,a)P(s' \mid s, a), Belohnungen und ein Diskontfaktor. Die Markov-Eigenschaft besagt, dass der aktuelle Zustand alle für die Zukunft relevanten Informationen enthält.

Minimax-Regretminimax regret

Entscheidungsregel für Situationen ohne Wahrscheinlichkeiten: Für jeden Zustand misst man das Bedauern (Regret) als Abstand zum besten Ergebnis in diesem Zustand und wählt die Handlung, deren größtes Bedauern am kleinsten ist.

Monte-Carlo-SimulationMonte Carlo simulation

Verfahren, das eine unsichere Größe schätzt, indem es ein Modell sehr oft mit zufällig gezogenen Eingaben durchrechnet und die Ergebnisse statistisch auswertet. Der Schätzfehler sinkt proportional zu 1/N1/\sqrt{N}, wobei NN die Zahl der Durchläufe ist.

Multi-Armed Banditmulti-armed bandit

Entscheidungsproblem, bei dem man wiederholt eine von mehreren Optionen („Armen“) mit unbekannter Erfolgsrate wählt und nur das Ergebnis der gewählten Option beobachtet. Ziel ist, die Summe der Belohnungen zu maximieren – man muss zugleich lernen und nutzen.

N

Nebenbedingungconstraint

Bedingung, die eine zulässige Lösung erfüllen muss, etwa eine Kapazitätsgrenze oder eine Mindestmenge. Harte Nebenbedingungen dürfen nie verletzt werden; weiche werden über Strafterme in der Zielfunktion abgewogen.

NP-schwerNP-hard

Klasse von Problemen, für die kein Algorithmus bekannt ist, der jede Instanz in polynomieller Zeit exakt löst. Für große Instanzen setzt man deshalb auf problemspezifische exakte Verfahren mit Schranken oder auf Heuristiken.

Nutzenfunktionutility function

Funktion uu, die Ergebnissen (etwa Geldbeträgen) einen Nutzenwert zuordnet. Ihre Krümmung bildet die Risikoeinstellung ab: konkav bei Risikoaversion, linear bei Risikoneutralität, konvex bei Risikofreude.

O

Optional Stoppingoptional stopping, peeking

Das Beenden eines Experiments abhängig von den bisherigen Ergebnissen, etwa sobald eine Kennzahl eine Schwelle überschreitet. Der bayessche Posterior bleibt dabei korrekt berechnet; die Fehlerraten einer Entscheidungsregel über viele Experimente verändern sich jedoch, wenn man wiederholt nachschaut.

P

p-Wertp-value

Die Wahrscheinlichkeit, unter der Nullhypothese ein mindestens so extremes Ergebnis zu beobachten wie das tatsächlich beobachtete. Er ist nicht die Wahrscheinlichkeit, dass die Nullhypothese stimmt, und kein Maß für die Größe eines Effekts.

Parameterparameter

Unbekannte Größe eines statistischen Modells, zum Beispiel eine Erfolgsquote θ\theta oder ein Mittelwert μ\mu. In der bayesschen Statistik wird ein Parameter durch eine Wahrscheinlichkeitsverteilung beschrieben.

Policypolicy

Die Strategie eines Agenten: eine Vorschrift π(a∣s)\pi(a \mid s), die jedem Zustand eine Aktion oder eine Wahrscheinlichkeitsverteilung über Aktionen zuordnet.

Posteriorposterior distribution

Verteilung eines Parameters nach Berücksichtigung der Daten: proportional zu Likelihood mal Prior, p(θ∣y)∝p(y∣θ) p(θ)p(\theta \mid y) \propto p(y \mid \theta)\,p(\theta). Aus ihr lassen sich Punktschätzer, Kredibilitätsintervalle und Wahrscheinlichkeiten für Aussagen ablesen.

Posterior-Predictive-Verteilungposterior predictive distribution

Verteilung zukünftiger Beobachtungen, gemittelt über alle plausiblen Parameterwerte: p(y~∣y)=∫p(y~∣θ) p(θ∣y) dθp(\tilde y \mid y) = \int p(\tilde y \mid \theta)\,p(\theta \mid y)\,\mathrm{d}\theta. Sie dient für Vorhersagen und für Modellprüfungen (Posterior-Predictive-Checks).

Predictive Analyticspredictive analytics

Schätzt mit statistischen Modellen oder maschinellem Lernen, was unter bestimmten Annahmen wahrscheinlich eintreten wird. Für Entscheidungen ist eine Prognose als Verteilung mit Prognoseintervall wertvoller als eine einzelne Zahl.

Prescriptive Analyticsprescriptive analytics

Leitet aus Prognosen, Zielen und Nebenbedingungen Handlungsempfehlungen ab, typischerweise mit Optimierung, Simulation oder Entscheidungsregeln. Sie setzt ausdrücklich formulierte Ziele und Grenzen voraus.

Priorprior distribution

Wahrscheinlichkeitsverteilung, die beschreibt, welche Werte eines unbekannten Parameters vor dem Blick auf die Daten plausibel sind. Sie kann flach, schwach informativ oder informativ sein und sollte begründet und dokumentiert werden.

Prognoseintervallprediction interval

Intervall, in das eine zukünftige Beobachtung mit vorgegebener Wahrscheinlichkeit fällt, etwa 80 %. Anders als ein Konfidenz- oder Kredibilitätsintervall für einen Parameter bezieht es sich auf einen künftigen Einzelwert und ist deshalb breiter.

Pseudozufallszahlenpseudo-random numbers

Zahlenfolgen, die ein deterministischer Algorithmus erzeugt und die statistisch wie Zufall wirken. Mit demselben Startwert (Seed) entsteht dieselbe Folge – das macht Simulationen reproduzierbar und prüfbar.

Q

Q-LearningQ-learning

Modellfreies Verfahren des Reinforcement Learning, das Aktionswerte aus Erfahrung lernt: Q(s,a)←Q(s,a)+α [r+γmax⁡a′Q(s′,a′)−Q(s,a)]Q(s,a) \leftarrow Q(s,a) + \alpha\,[r + \gamma \max_{a'} Q(s',a') - Q(s,a)]. Es lernt die Werte der optimalen Policy, auch während der Agent erkundet (Off-Policy-Lernen).

Quantil (Perzentil)quantile, percentile

Der Wert, unter dem ein bestimmter Anteil einer Verteilung liegt. Das 90-%-Quantil, kurz P90, wird in 90 % der Fälle nicht überschritten; der Median ist das 50-%-Quantil.

R

Regretregret

Differenz zwischen der erwarteten Belohnung, die man mit der besten Option erzielt hätte, und der tatsächlich erzielten: RT=Tμ∗−E[∑trt]R_T = T\mu^* - \mathbb{E}[\sum_t r_t]. Der Regret misst die Kosten des Lernens; gute Bandit-Algorithmen lassen ihn nur logarithmisch wachsen.

Reinforcement Learningreinforcement learning

Teilgebiet des maschinellen Lernens, in dem ein Agent durch Interaktion mit einer Umgebung lernt, Aktionen so zu wählen, dass die langfristige, meist abgezinste Summe der Belohnungen möglichst groß wird. Auf Deutsch auch bestärkendes Lernen.

Risikoaversionrisk aversion

Eigenschaft eines Entscheiders, der einen sicheren Betrag einer Lotterie mit gleichem Erwartungswert vorzieht. Formal gehört dazu eine konkave Nutzenfunktion; das Sicherheitsäquivalent liegt dann unter dem Erwartungswert.

ROPEregion of practical equivalence

Region praktischer Äquivalenz: ein vorab festgelegter Bereich von Effektgrößen, die als praktisch gleichwertig mit null gelten. Liegt das Intervall höchster Posterior-Dichte ganz außerhalb, gilt ein Effekt als relevant; liegt es ganz innerhalb, als vernachlässigbar.

S

Sample Ratio Mismatchsample ratio mismatch (SRM)

Deutliche Abweichung der tatsächlichen Aufteilung der Nutzer von der geplanten, etwa 50,8 zu 49,2 statt 50 zu 50 bei großen Stichproben. Meist ein Hinweis auf technische Fehler bei Zuteilung oder Messung; die Testergebnisse sind dann nicht vertrauenswürdig.

Schattenpreisshadow price, dual value

Verbesserung des optimalen Zielwerts pro zusätzlicher Einheit einer knappen Ressource, also der Wert der zugehörigen Dualvariable. Er gilt nur in einem Bereich, in dem dieselben Nebenbedingungen bindend bleiben; nicht ausgeschöpfte Ressourcen haben den Schattenpreis null.

Schedulingscheduling

Planung, welche Aufgaben wann auf welchen Ressourcen bearbeitet werden, unter Zielen wie kurzer Durchlaufzeit oder geringer Verspätung. Schon einfache Varianten wie das Job-Shop-Problem sind NP-schwer.

Sensitivitätsanalysesensitivity analysis

Untersuchung, wie stark ein Modellergebnis auf Änderungen einzelner Eingaben oder Annahmen reagiert. Varianzbasierte Varianten messen, welcher Anteil der Streuung des Ergebnisses auf welche Eingabe zurückgeht.

Shrinkageshrinkage

Das Zusammenziehen einer Schätzung in Richtung einer Vorannahme oder eines Gesamtmittels. Im Beta-Binomial-Modell ist der Posterior-Mittelwert ein gewichteter Durchschnitt aus Prior-Mittelwert und beobachteter Quote; das schützt kleine Stichproben vor extremen Schätzungen.

Sicherheitsäquivalentcertainty equivalent

Der sichere Betrag, den ein Entscheider als gleichwertig zu einer riskanten Alternative ansieht: u(SA¨)=E[u(X)]u(\text{SÄ}) = \mathbb{E}[u(X)]. Die Differenz zwischen Erwartungswert und Sicherheitsäquivalent heißt Risikoprämie.

Simplex-Verfahrensimplex method

Von George B. Dantzig entwickeltes Verfahren für lineare Programme, das von Ecke zu benachbarter Ecke des zulässigen Bereichs wandert und dabei den Zielwert nie verschlechtert. Im ungünstigsten Fall exponentiell, in der Praxis meist sehr schnell.

Standardfehlerstandard error

Standardabweichung eines Schätzers über gedachte Wiederholungen der Stichprobe oder Simulation. Für einen Mittelwert aus NN unabhängigen Werten beträgt er σ/N\sigma/\sqrt{N}; rund 95 % der Schätzungen liegen innerhalb von zwei Standardfehlern um den wahren Wert.

Szenarioscenario

Eine in sich stimmige Annahme über die Zukunft – etwa über Nachfrage, Preise oder Ausfälle –, unter der Handlungsoptionen durchgerechnet werden. Eine Monte-Carlo-Simulation erzeugt viele Szenarien aus Wahrscheinlichkeitsverteilungen und zeigt so die Bandbreite möglicher Ergebnisse.

T

Temporal-Difference-Lernentemporal-difference learning

Familie von Lernverfahren, die Wertschätzungen nach jedem Schritt in Richtung eines Ziels aus beobachteter Belohnung und geschätztem Folgewert verschieben. Die Differenz zwischen Ziel und bisheriger Schätzung heißt TD-Fehler.

Thompson SamplingThompson sampling, probability matching

Strategie für Bandit-Probleme: Man zieht aus dem Posterior jeder Option einen Zufallswert und wählt die Option mit dem größten Wert. Dadurch wird jede Option genau mit der Wahrscheinlichkeit gewählt, mit der sie nach aktuellem Wissen die beste ist.

U

UCB (Upper Confidence Bound)upper confidence bound

Familie von Bandit-Strategien nach dem Prinzip „Optimismus bei Unsicherheit“: Jede Option wird nach einer oberen Vertrauensgrenze ihrer Rate bewertet. UCB1 wählt den Arm mit dem größten Wert μ^i+2ln⁡t/ni\hat\mu_i + \sqrt{2\ln t / n_i}; selten gespielte Arme erhalten so einen Bonus.

Upliftuplift, relative lift

Relative Verbesserung einer Variante gegenüber der Kontrolle, meist pB/pA−1p_B / p_A - 1. Neben dem Punktwert gehört immer ein Intervall dazu, denn gerade bei kleinen Effekten ist die Unsicherheit über die Größe oft erheblich.

V

Value Iterationvalue iteration

Verfahren der dynamischen Programmierung, das die Bellman-Optimalitätsgleichung wiederholt als Aktualisierungsvorschrift anwendet, bis sich die Werte nicht mehr ändern. Es setzt bekannte Übergänge und Belohnungen voraus.

Varianzreduktionvariance reduction

Techniken, die die Streuung einer Monte-Carlo-Schätzung bei gleicher Zahl von Durchläufen verringern, etwa antithetische Variablen, gemeinsame Zufallszahlen, Kontrollvariablen oder Importance Sampling.

W

Wert der Informationvalue of information (EVPI, EVSI)

Um wie viel sich der beste erreichbare Erwartungswert verbessert, wenn man vor der Entscheidung zusätzliche Information erhält. Der Wert vollkommener Information (EVPI) ist die Obergrenze für jede Studie; der Wert einer konkreten Stichprobe oder eines Tests heißt EVSI.

Wertfunktionvalue function

Erwarteter künftiger Return, wenn man in einem Zustand startet (Zustandswert Vπ(s)V^\pi(s)) oder dort zuerst eine bestimmte Aktion wählt (Aktionswert Qπ(s,a)Q^\pi(s, a)) und danach der Policy π\pi folgt.

Z

Zentraler Grenzwertsatzcentral limit theorem

Satz der Wahrscheinlichkeitstheorie: Die geeignet standardisierte Summe vieler unabhängiger Zufallsgrößen mit endlicher Varianz ist näherungsweise normalverteilt. Daraus folgt, dass der Fehler eines Mittelwerts ungefähr normalverteilt ist, mit Standardabweichung σ/N\sigma/\sqrt{N}.

Zielfunktionobjective function

Die Größe, die ein Optimierungsmodell maximiert oder minimiert, zum Beispiel Deckungsbeitrag, Kosten oder Verspätung. Welche Lösung „optimal“ ist, hängt vollständig von ihrer Formulierung ab.

Zulässiger Bereichfeasible region

Menge aller Lösungen, die sämtliche Nebenbedingungen erfüllen. Bei einem linearen Programm ist er ein konvexes Polyeder; ist er leer, heißt das Problem unzulässig.

Von NyxAI

smartlytics ist das Wissensangebot der NyxAI GmbH.

Wir erklären hier die Methoden, mit denen wir arbeiten – offen, mit Quellen und so, dass man sie nachrechnen kann.

nyxai.com

Entscheidungskern

NyxAI entwickelt einen Entscheidungskern (Decision Core) für Decision Intelligence, der Optimierung, Simulation, Statistik und Reinforcement Learning verbindet: Optionen vergleichen, Unsicherheit sichtbar machen, aus Ergebnissen lernen – unter menschlicher Verantwortung.

Plattform ansehen

DeepSquare

Erklärbare Schach-KI mit menschlichen Spielstilen: das Testfeld von NyxAI für nachvollziehbare Entscheidungen unter Zeitdruck.

DeepSquare bei NyxAI
deepsquare.aibald