Operations Runbook
Resilience Experiment sicher vorbereiten und abbrechen
Vorbereitung
- Owner und Incident-Kommunikationsweg bestätigen
- Steady-State-Dashboard prüfen
- Blast Radius und Traffic Selector verifizieren
- Stop-Automation testen
- Daten- und Recovery-Risiko freigeben
Sofort abbrechen
- nicht erwartete Benutzerkohorte betroffen
- Dateninkonsistenz oder doppelte Zahlung
- Telemetry-Verlust
- Queue-Wachstum außerhalb der Grenze
- Recovery-Ziel nicht erreichbar
Abbruch und Recovery
# Beispielhafte, manuell zu prüfende Reihenfolge
experimentctl stop payment-latency-synthetic
kubectl -n commerceone rollout status deployment/payment-adapter
promtool query instant http://prometheus:9090 'checkout_success_ratio'
# Danach: Order-/Payment-Konsistenz und Queue-Fortschritt fachlich prüfen.
Prüfgrenze: Befehle sind Beispiele; Zielumgebung, Namespace, Authentisierung und Freigabe müssen vor jeder Nutzung validiert werden.