Diese Kurzfassung beschreibt Zweck, Wirkung und Grenzen der Methodik — nicht die konkrete Implementierung. Sie ist als Diskussionsgrundlage für Fach- und Governance-Verantwortliche gedacht.
Ein KI-Modell im Betrieb liefert pro Validierungsperiode oft nur wenige belastbare Ground-Truth-Ergebnisse. Eine rein lokale Messung ist dadurch verrauscht — sie schlägt entweder zu oft Alarm oder erkennt echte Verschiebungen zu spät.
Statt ein Modell nur an seinen eigenen, oft wenigen Messwerten zu beurteilen, vergleicht KI_AUDIT diese mit dem Verhalten vieler vergleichbarer Systeme. Das Verfahren stammt aus der Credibility-Theorie der Versicherungsmathematik: Es gewichtet das lokale Signal gegen das kollektive Erfahrungswissen — je dünner die lokale Datenlage, desto stärker zählt der Vergleich. So wird echtes Drift-Signal von zufälligem Rauschen getrennt.
Die konkrete Schätz- und Kalibrierungs-Mechanik ist zum Patent angemeldet (USPTO Provisional). Diese Seite beschreibt bewusst die Wirkung, nicht die Formel.
In der Sprache des Model Risk Managements: Kalibrierung, Diskriminierung, Stabilität (PSI/CSI) und Backtesting — gemessen über den Lebenszyklus, nicht nur bei Freigabe.
Abweichung der eingeordneten Schätzung von der naiven lokalen Messung — mit Unsicherheitsband.
Wie deutlich und wie früh sich eine Verschiebung der Ergebnisse gegen die Freigabe-Schwellenwerte zeigt.
Zerlegung beobachteter Fehler in lokale Streuung, echtes Drift-Signal und Populations-Effekt.
Korrelierte Fehler über Modelle mit gemeinsamer Datenherkunft oder Architektur — als Konzentrations-Sicht.
In einer reproduzierbaren Simulation (60 vergleichbare Modelle, davon 18 driftend, dünne Datenlage) wurde die credibility-gewichtete Schätzung gegen die naive lokale Messung getestet.
Bei gleicher Drift-Detektion — beide Verfahren erkennen die driftenden Modelle — senkt die credibility-gewichtete Schätzung die Fehlalarme im Median um rund ein Drittel (über mehrere Läufe; Spanne je nach Lauf). Weniger Fehlalarme bedeuten weniger Alert-Fatigue und klarere Signale für die zweite Linie.
Synthetische Evaluation zur Methodik-Illustration — kein echter Kunde, keine echten Daten. Reproduzierbar; Skript und Ergebnisse auf Anfrage.
KI_AUDIT liefert Messung und Evidenz — die Entscheidungen treffen weiterhin Sie. Das hält die Rollen sauber getrennt und schafft keine neue Abhängigkeit.
| Funktion | Verantwortlich |
|---|---|
| Schwellenwert-Definition | Ihr Haus |
| Modell-Freigabe & Risikoentscheidung | Ihr Haus |
| Bepreisung / Kapazität | Ihr Haus |
| Messung gegen Schwellenwerte, Evidenz, Reproduzierbarkeit | KI_AUDIT |
Schwellenwerte, Modell-Freigabe und Bepreisung bleiben vollständig in Ihrer Hand; KI_AUDIT liefert die unabhängige Mess- und Evidenz-Basis dazu.