Schwellenwert-Validierung driftender KI-Systeme

Ihre KI-Modelle wurden vor dem ersten Einsatz geprüft. Im laufenden Einsatz oft nicht mehr.

KI_AUDIT prüft, ob die Ergebnisse produktiver KI-Systeme im laufenden Einsatz gegen ihre Freigabe-Schwellenwerte belastbar bleiben — damit Freigaben, interne Prüfungen und Aufsichtsgespräche auf belastbarem Boden stehen, auch wenn Modelle driften.

Executive Summary

Organisationen validieren KI-Modelle bei der Freigabe und überwachen im Betrieb technische Metriken wie Latenz, Verfügbarkeit und Datenqualität. In klassischen Prüfformaten typischerweise nicht adressiert: ob die inhaltlichen Ergebnisse eines Modells noch gegen die bei Freigabe gesetzten Schwellenwerte halten, wenn sich Daten, Nutzung und Umfeld verschieben. Diese Ebene — die Belastbarkeit von KI-Ergebnissen über den Lebenszyklus, gemessen gegen definierte Schwellenwerte — ist der Gegenstand von KI_AUDIT.

Relevant u.a. für: EU AI Act · ISO/IEC 42001 · NIST AI RMF · EIOPA-Erwartungen an Model Monitoring

01 — Warum das relevant istModell-Drift ist die ungeprüfte Ebene zwischen Freigabe und Betrieb

Ein KI-Modell wird bei Roll-out geprüft und freigegeben. Danach verschieben sich Eingabedaten, Nutzungsmuster und Umfeld — und mit ihnen die Ergebnisse. Ob diese noch gegen die Freigabe-Schwellenwerte halten, wird selten formal nachgeprüft.

Und das ist kein Randfall: Eine in Scientific Reports (Nature, 2022) veröffentlichte Studie von Forschenden aus Harvard, MIT und dem Whitehead Institute fand über 32 Datensätze aus vier Branchen in 91 % der untersuchten Fälle eine Verschlechterung der Modellgüte über die Zeit — „AI aging". Quelle

Technisches Monitoring erfasst Latenz, Verfügbarkeit und Datenqualität. Model Validation prüft das Modell zum Freigabezeitpunkt. Die inhaltliche Frage dazwischen — halten die Ergebnisse über die Zeit gegen die definierten Schwellenwerte — fällt zwischen die Zuständigkeiten.

Diagramm: die tatsächliche Fehlerrate eines KI-Modells steigt nach Drift-Beginn über das Freigabe-Band, während technische Monitoring-Metriken unauffällig bleiben.
Schematisch: Nach Drift-Beginn verlassen die Ergebnisse das Freigabe-Band. Technische Monitoring-Metriken bleiben dabei unauffällig.
Illustratives Szenario

Ein KI-Modell im Underwriting-Support wird bei Freigabe gegen eine Fehler-Schwelle von 10 % geprüft und läuft 14 Monate produktiv. Technisches Monitoring: durchgehend grün — Latenz, Verfügbarkeit und Datenqualität unauffällig.

Tatsächlich ist die Fehlerrate der Ergebnisse schrittweise auf rund 18 % gestiegen. Die Ergebnisse haben ihr Freigabe-Band verlassen — ohne dass eine Instanz sie im Betrieb gegen die Schwellenwerte geprüft hätte.

Konsequenz: Entscheidungen auf Basis von Ergebnissen außerhalb ihres geprüften Bands; die Haftung dafür verbleibt beim Betreiber; und im Nachhinein ist ein einzelnes Ergebnis nur schwer zu rekonstruieren. (Illustrativ, kein realer Fall.)

02 — Was Sie riskieren, wenn es ungeprüft bleibtKonkrete Konsequenzen ungeprüfter Schwellenwert-Belastbarkeit

Typische Konsequenzen
  • KI-Ergebnisse, die außerhalb ihres Freigabe-Bands liegen, ohne dass es dokumentiert ist
  • Scheinsicherheit auf Executive-Ebene — „das Modell wurde geprüft" gilt für die Freigabe, nicht für den heutigen Betrieb
  • Fehler, die sich über korrelierte Modelle akkumulieren, ohne als Konzentration sichtbar zu werden
  • KI-Governance-Aussagen, die einer Aufsichtsprüfung im Betriebszustand nicht standhalten
  • Haftung für KI-Ergebnisse, die beim Betreiber verbleibt — auch wenn das Modell zugekauft wurde
  • Fehlende Nachvollziehbarkeit eines einzelnen Modellergebnisses Monate später

Warum jetzt: Laufendes Monitoring ist gefordert, nicht Kür: EU AI Act Art. 72 (Post-Market-Monitoring) und Art. 15 (Genauigkeit und Robustheit über den Lebenszyklus), die EIOPA-Opinion zur KI-Governance (2025) und das NIST AI RMF (fortlaufendes MEASURE/MANAGE) verlangen die Überwachung über den Betrieb hinweg. KI_AUDIT ist die spezialisierte Prüfdisziplin dafür.

03 — Was Sie erhaltenVier konkrete Deliverables je KI_AUDIT-Prüfung

Am Ende steht kein Gutachten im Regal — sondern Material, das Rekonstruktionsaufwand senkt, interne Freigaben beschleunigt, das Haftungsrisiko bei KI-gestützten Entscheidungen reduziert und Nachweise für Aufsicht und Revision auf Abruf bereitstellt:

Deliverable 1
KI-Drift-Report

Technische Analyse je Modell: Calibration Lift, Drift-Sensitivität und Fehler-Attribution gegen die Freigabe-Schwellenwerte, mit dokumentierten Annahmen und Grenzen. 25–40 Seiten.

Deliverable 2
Schwellenwert-Validierungs-Matrix

Visuelle Landkarte Ihrer KI-Modelle: jedes Modell bewertet nach Schwellenwert-Belastbarkeit, Drift-Sensitivität und Akkumulations-Exposure. Ampel-basiert.

Deliverable 3
Risk Register KI-Modelle

Priorisierte Risiko-Datenbank aller identifizierten Drift- und Akkumulations-Risiken mit drei Bewertungsdimensionen: Aufsichtsrelevanz, Executive-Impact, Behebungsaufwand.

Deliverable 4
Model-Governance-Empfehlungen

Priorisierter Handlungsplan: welche Schwellenwerte zu rekalibrieren sind, welche Modelle laufende Drift-Dokumentation brauchen, welche Akkumulationen als bekannt dokumentiert bleiben können.

04 — Methodik & WirksamkeitWie wir prüfen — und was die Methode messbar bringt

KI_AUDIT misst die Ergebnisse eines Modells nicht nur lokal, sondern ordnet sie gegen eine belastbare Vergleichsbasis vergleichbarer Systeme ein. Das Verfahren stammt aus der Credibility-Theorie der Versicherungsmathematik: Es trennt echtes Drift-Signal von lokaler Streuung — gerade dann, wenn pro Modell nur wenige belastbare Ergebnisse vorliegen. In der Sprache des Model Risk Managements: Kalibrierung, Diskriminierung und Stabilität (PSI/CSI) — gemessen nicht nur bei Freigabe, sondern laufend.

Balkendiagramm: Fehlalarme bei gleicher Drift-Detektion, naive Messung 36 Prozent gegenüber credibility-gewichtet 24 Prozent.

Bei gleicher Drift-Detektion: rund ein Drittel weniger Fehlalarme.

In einer reproduzierbaren synthetischen Evaluation (60 vergleichbare Modelle, dünne Datenlage) erkennt die credibility-gewichtete Schätzung dieselben driftenden Modelle wie die naive lokale Messung — bei deutlich weniger Fehlalarmen. Weniger Fehlalarme heißt weniger Alert-Fatigue und klarere Signale für die zweite Linie.

Synthetische Evaluation — sie zeigt das Prinzip, keinen Wirksamkeitsnachweis an Kundenmodellen. Dargestellt ist ein repräsentativer Lauf; im Median über mehrere Läufe rund ein Drittel weniger Fehlalarme. Der belastbare Nachweis entsteht im Pilot an Ihren Modellen.

05 — KI_AUDIT im KontextWo KI_AUDIT im Assurance-Ökosystem steht

KI_AUDIT ersetzt keine bestehende Funktion. KI_AUDIT schließt eine Lücke, die zwischen Model Validation, Monitoring und Audit liegt.

InstanzPrüfgegenstand
Model ValidationEinzelnes Modell bei Freigabe: methodische Güte, Backtesting, Kalibrierung
MLOps / MonitoringTechnische Metriken im Betrieb: Latenz, Verfügbarkeit, Datenqualität
Internal AuditProzesse und Kontrollen im KI-Governance-Rahmen
KI_AUDITDie Belastbarkeit von KI-Modell-Ergebnissen über den Betriebslebenszyklus — Schwellenwert-Validierung bei Drift, inklusive Fehler-Attribution und Akkumulation über korrelierte Modelle

06 — Wie wir arbeitenFünf strukturierte KI_AUDIT-Prüfschritte

KI_AUDIT Scoping
Inventur der KI-Modelle. Priorisierung nach Drift-Risiko und Entscheidungsnähe.
KI_AUDIT Baseline
Rekonstruktion der Freigabe-Schwellenwerte und der bei Roll-out geltenden Annahmen.
KI_AUDIT Drift Analysis
Aktuelle Ergebnisse gegen die Freigabe-Baseline. Calibration Lift, Drift-Sensitivität, Fehler-Attribution, Akkumulation.
KI_AUDIT Findings Workshop
Priorisierung mit Ihren Fach- und Governance-Verantwortlichen. Kalibrierung, Handlungs-Ableitung.
KI_AUDIT Assurance Report
Übergabe aller vier Deliverables. Optional: Executive-Debriefing.

Vollständiges Assessment: sechs bis acht Wochen. Ihre interne Beteiligung: drei bis fünf Termine à 60–90 Min plus Dokumenten-Bereitstellung.

07 — Für wenHäuser mit produktiven KI-Modellen unter Governance-Anspruch

KI_AUDIT ist auf Organisationen zugeschnitten, in denen KI-Ergebnisse Entscheidungen tragen, die Aufsichts-, Vorstands- oder Kunden-Fragen aushalten müssen.

Rückversicherer mit KI-Modell-Portfolios
Schwellenwert-Verlässlichkeit über Modell-Landschaften, u.a. im Kontext von KI-Performance-Deckungen und Akkumulations-Kontrollen.
Erstversicherer mit produktiver KI
KI-gestütztes Underwriting und Claims-Handling: Belastbarkeit der Ergebnisse über den Betrieb, Nachvollziehbarkeit im Einzelfall.
Banken mit KI-basierten Risiko-Modellen
Scoring- und Entscheidungs-Modelle unter Modell-Risiko-Anforderungen: Drift gegen Freigabe-Schwellenwerte, korrelierte Fehler.
Konzerne mit Multi-Modell-KI-Landschaften
Modell-Zoo unter EU-AI-Act-Pflicht: konsistente Schwellenwert-Belastbarkeit und Akkumulations-Sicht über viele Modelle.

08 — RahmenInvestitions-Größenordnung

ab 100.000 €
pro Assessment, sechsstelliger Bereich je nach Scope und Modell-Anzahl

Der finale Rahmen wird nach dem KI_AUDIT Executive Briefing auf Basis Ihrer konkreten Modell-Landschaft festgelegt. KI_AUDIT wird durch ein Senior-Team direkt betreut, ohne Delegation an Junior-Ressourcen. Delivery & Sicherheit: read-only, EU-Datenresidenz, Datenminimierung und Löschung nach Abschluss, NDA-Standard — Details in der Methodik-Kurzfassung.

09 — HintergrundKI_AUDIT ist eine Sparte der ARQON Group

Die ARQON Group arbeitet an der Schnittstelle von KI-Governance, aktuarieller Methodik und Aufsichts-Anforderungen. Das Team bringt Erfahrung aus Risk Management, Modellprüfung, Standards-Arbeit und Aufsichts-Kommunikation mit. Bei Bedarf ergänzen wir kunden-spezifisch mit ausgewählten Fachexperten.

Die KI_AUDIT-Methodik verbindet etablierte Credibility-Theorie aus der Versicherungsmathematik mit aktueller Forschung zu Modell-Drift und vergleichender Modellbewertung. Für KI_AUDIT-Assessments arbeiten wir mit einer begrenzten Anzahl paralleler Kunden.

Innerhalb der ARQON Group prüft KI_AUDIT die Belastbarkeit von KI-Ergebnissen gegen ihre Schwellenwerte über den Betriebslebenszyklus — Drift, auch über korrelierte Modelle hinweg. Geht es dagegen um die Zusammenführung mehrerer Bewertungen, Ratings oder Kanäle zu einer tragenden Gesamt-Aussage, ist die Schwester-Sparte ACRA der richtige Ansprechpartner.

10 — Häufige FragenFAQ

Warum gibt es KI_AUDIT — reicht unsere Model Validation nicht?
Model Validation prüft ein Modell zum Freigabezeitpunkt: methodische Güte, Backtesting, Kalibrierung. Sie sagt nichts darüber, ob die Ergebnisse zwölf Monate später noch gegen dieselben Schwellenwerte halten. Genau diese Betriebs-Ebene füllt KI_AUDIT — beides zusammen ergibt eine durchgängige Aussage über den Modell-Lebenszyklus.
Warum KI_AUDIT und nicht eine große Prüfungs- oder Beratungsgesellschaft?
Große Häuser prüfen breit — KI_AUDIT ist auf eine Frage spezialisiert: die Schwellenwert-Belastbarkeit von KI-Ergebnissen im Betrieb. Die Prüfung ist unabhängig vom Modellbau (wir bauen keine Modelle und haben kein Interesse an einem bestimmten Ergebnis), methodisch fokussiert und stützt sich auf ein eigenes, zum Patent angemeldetes Verfahren statt auf generische Governance-Checklisten.
Ersetzt KI_AUDIT unser Model Monitoring?
Nein. Model Monitoring erfasst technische Metriken wie Latenz, Verfügbarkeit und Datenqualität. KI_AUDIT adressiert die inhaltliche Frage: bleibt das Ergebnis gegen definierte Schwellenwerte belastbar, und wie ordnet sich Fehler zu, wenn Modelle korrelieren. Monitoring und KI_AUDIT ergänzen sich.
Ist KI_AUDIT ein Audit im klassischen Sinne?
KI_AUDIT ist eine Assurance-Prüfung, kein Testat nach IDW-Standards. Wir liefern belastbare inhaltliche Aussagen zur Schwellenwert-Belastbarkeit Ihrer KI-Modelle, die Sie intern und gegenüber Aufsicht argumentativ nutzen können. Verantwortung und Freigabe verbleiben bei Ihnen.
Funktioniert das auch für ein einzelnes Modell?
Ja. Die Methodik entfaltet ihre volle Stärke bei Modell-Portfolios mit vergleichbaren Systemen, weil die Einordnung der Ergebnisse eine Vergleichsbasis voraussetzt. Für ein Einzelmodell reduziert sich die Prüfung auf die lokale Schwellenwert- und Drift-Analyse.
Welche Daten benötigen Sie?
Beschreibungen Ihrer Modelle und der bei Freigabe gesetzten Schwellenwerte, exemplarische Ergebnis- und Performance-Logs sowie Angaben zu Modell-Herkunft und Einsatzkontext. Wir arbeiten primär mit Struktur- und Metadaten, mit Datenminimierung und Löschung nach Abschluss. NDA ist Standard.
Wie lange dauert ein Assessment?
Sechs bis acht Wochen vom Scoping bis zur Übergabe der Deliverables. Ihre interne Beteiligung liegt bei drei bis fünf Terminen à 60–90 Minuten plus Dokumenten-Bereitstellung.

KI_AUDIT Executive Briefing

Ein strukturiertes 45-Minuten-Erstgespräch, in dem wir gemeinsam eingrenzen, wo in Ihrem Modell-Portfolio die Schwellenwert-Belastbarkeit am ehesten offen ist.

Briefing anfragen kontakt@arqon.group