⌂ HomeAI Model Incident Runbook
Operations Runbook

AI Model Incident Runbook

Triage, Containment, Diagnose, Recovery und Prävention bei AI-Vorfällen.

Zweck

Dieses Runbook steuert Qualitäts-, Drift-, Safety- und Security-Vorfälle produktiver AI-Systeme.

1 · Triage

  • Use Case, Modell-/Promptversion und betroffene Segmente bestimmen
  • Business Impact, Datenklasse und Automatisierungsgrad bewerten
  • Quality, Safety, Security, Latenz und Kosten prüfen

2 · Containment

  • Traffic reduzieren, Modell sperren oder Fallback aktivieren
  • Tool-Nutzung und externe Datenzugriffe begrenzen
  • Betroffene Entscheidungen und Evidence sichern

3 · Diagnose

  • Input, Feature/Retrieval, Modell/Prompt, Guardrail und Serving korrelieren
  • Drift, Datenfehler, Supply-chain und Konfigurationsänderungen prüfen
  • Evaluation gegen aktuelle Incident-Fälle wiederholen

4 · Recovery

  • Rollback oder korrigiertes Artefakt kontrolliert ausrollen
  • Shadow/Canary und Segmentmetriken validieren
  • Fehlentscheidungen fachlich reconciliieren

5 · Prevention

  • Evaluation Suite und Guardrail erweitern
  • Model Card, Risk Register und SLO aktualisieren
  • Owner, Freigabepolicy oder Human Oversight anpassen
⌂ Cockpit