Operations Runbook

Data Incident Response Runbook

Triage, Containment, Lineage-Analyse, Recovery, Kommunikation und Prävention bei Datenfehlern.

Zweck

Dieses Runbook steuert Vorfälle mit falschen, verspäteten oder unvollständigen Datenprodukten.

1 · Triage

  • Betroffene Data Products und Konsumenten identifizieren
  • Freshness, Completeness, Schema und Distribution prüfen
  • Business Impact und Datenklasse bestimmen

2 · Containment

  • Publikation oder abhängige Reports stoppen
  • Consumer sichtbar warnen
  • Fehlerhafte Partitionen und Artefakte markieren

3 · Diagnose

  • Lineage rückwärts verfolgen
  • Contract-, Schema- und Pipeline-Änderungen korrelieren
  • Source, CDC, Transformation und Storage einzeln validieren

4 · Recovery

  • Fix validieren und idempotent deployen
  • Backfill in isolierter Umgebung testen
  • Reconciliation gegen autoritative Quelle durchführen

5 · Communication

  • Owner, Consumers, Security und Compliance informieren
  • Unsicherheit und korrigierte Zeiträume klar nennen
  • Audit Evidence und Entscheidungen speichern

6 · Prevention

  • Quality Rule oder Contract verschärfen
  • Lineage- und SLO-Lücke schließen
  • Error Budget und Review Trigger aktualisieren
⌂ Cockpit