Operations Runbook

Resilience Experiment sicher vorbereiten und abbrechen

Vorbereitung

  1. Owner und Incident-Kommunikationsweg bestätigen
  2. Steady-State-Dashboard prüfen
  3. Blast Radius und Traffic Selector verifizieren
  4. Stop-Automation testen
  5. Daten- und Recovery-Risiko freigeben

Sofort abbrechen

  • nicht erwartete Benutzerkohorte betroffen
  • Dateninkonsistenz oder doppelte Zahlung
  • Telemetry-Verlust
  • Queue-Wachstum außerhalb der Grenze
  • Recovery-Ziel nicht erreichbar
Abbruch und Recovery
# Beispielhafte, manuell zu prüfende Reihenfolge
experimentctl stop payment-latency-synthetic
kubectl -n commerceone rollout status deployment/payment-adapter
promtool query instant http://prometheus:9090 'checkout_success_ratio'
# Danach: Order-/Payment-Konsistenz und Queue-Fortschritt fachlich prüfen.
Prüfgrenze: Befehle sind Beispiele; Zielumgebung, Namespace, Authentisierung und Freigabe müssen vor jeder Nutzung validiert werden.
⌂ Cockpit