Methodik — Kurzfassung

Wie KI_AUDIT die Belastbarkeit von KI-Ergebnissen über den Betrieb prüft

Diese Kurzfassung beschreibt Zweck, Wirkung und Grenzen der Methodik — nicht die konkrete Implementierung. Sie ist als Diskussionsgrundlage für Fach- und Governance-Verantwortliche gedacht.

01 — AnsatzCredibility-gewichtete Einordnung statt reiner lokaler Messung

Ein KI-Modell im Betrieb liefert pro Validierungsperiode oft nur wenige belastbare Ground-Truth-Ergebnisse. Eine rein lokale Messung ist dadurch verrauscht — sie schlägt entweder zu oft Alarm oder erkennt echte Verschiebungen zu spät.

Statt ein Modell nur an seinen eigenen, oft wenigen Messwerten zu beurteilen, vergleicht KI_AUDIT diese mit dem Verhalten vieler vergleichbarer Systeme. Das Verfahren stammt aus der Credibility-Theorie der Versicherungsmathematik: Es gewichtet das lokale Signal gegen das kollektive Erfahrungswissen — je dünner die lokale Datenlage, desto stärker zählt der Vergleich. So wird echtes Drift-Signal von zufälligem Rauschen getrennt.

Die konkrete Schätz- und Kalibrierungs-Mechanik ist zum Patent angemeldet (USPTO Provisional). Diese Seite beschreibt bewusst die Wirkung, nicht die Formel.

02 — Vier Evidenz-DimensionenWas die Prüfung je Modell liefert

In der Sprache des Model Risk Managements: Kalibrierung, Diskriminierung, Stabilität (PSI/CSI) und Backtesting — gemessen über den Lebenszyklus, nicht nur bei Freigabe.

Calibration Lift

Abweichung der eingeordneten Schätzung von der naiven lokalen Messung — mit Unsicherheitsband.

Drift-Sensitivität

Wie deutlich und wie früh sich eine Verschiebung der Ergebnisse gegen die Freigabe-Schwellenwerte zeigt.

Fehler-Attribution

Zerlegung beobachteter Fehler in lokale Streuung, echtes Drift-Signal und Populations-Effekt.

Akkumulations-Kontrollen

Korrelierte Fehler über Modelle mit gemeinsamer Datenherkunft oder Architektur — als Konzentrations-Sicht.

03 — Synthetische EvaluationWas die Einordnung messbar bringt

In einer reproduzierbaren Simulation (60 vergleichbare Modelle, davon 18 driftend, dünne Datenlage) wurde die credibility-gewichtete Schätzung gegen die naive lokale Messung getestet.

Fehlalarme bei gleicher Drift-Detektion: naiv 36 Prozent, credibility 24 Prozent

Bei gleicher Drift-Detektion — beide Verfahren erkennen die driftenden Modelle — senkt die credibility-gewichtete Schätzung die Fehlalarme im Median um rund ein Drittel (über mehrere Läufe; Spanne je nach Lauf). Weniger Fehlalarme bedeuten weniger Alert-Fatigue und klarere Signale für die zweite Linie.

Synthetische Evaluation zur Methodik-Illustration — kein echter Kunde, keine echten Daten. Reproduzierbar; Skript und Ergebnisse auf Anfrage.

04 — Klare RollenIhre Entscheidungshoheit bleibt bei Ihnen

KI_AUDIT liefert Messung und Evidenz — die Entscheidungen treffen weiterhin Sie. Das hält die Rollen sauber getrennt und schafft keine neue Abhängigkeit.

FunktionVerantwortlich
Schwellenwert-DefinitionIhr Haus
Modell-Freigabe & RisikoentscheidungIhr Haus
Bepreisung / KapazitätIhr Haus
Messung gegen Schwellenwerte, Evidenz, ReproduzierbarkeitKI_AUDIT

Schwellenwerte, Modell-Freigabe und Bepreisung bleiben vollständig in Ihrer Hand; KI_AUDIT liefert die unabhängige Mess- und Evidenz-Basis dazu.

05 — Anwendungsbereich & GrenzenWo die Methodik wirkt — und wo ihre Grenzen liegen

06 — Delivery & SicherheitWie ein Engagement technisch und datenschutzseitig läuft