Erste fünfzehn Minuten
Incident Lead benennen, Auswirkung und Beginn eingrenzen, Änderungen stoppen, Timeline eröffnen und volatile Evidence sichern. Ursache noch nicht behaupten.
Produktionsstörungen unter Zeitdruck analysieren, stabilisieren und dauerhaft beheben. Nutze die Seite bei einer Störung oder auffälligen Messwerten: Sichere zuerst Evidenz, stabilisiere den Betrieb und trenne Workaround, Ursache und dauerhaften Fix.
Lies zuerst Lage und Nutzerwirkung, bevor du eine Maßnahme auswählst. Beobachte danach nicht nur den technischen Wert, sondern auch Folgeschäden und Recovery; wiederhole das Szenario, bis du die Entscheidung mit Signalen begründen kannst.
Incident Lead benennen, Auswirkung und Beginn eingrenzen, Änderungen stoppen, Timeline eröffnen und volatile Evidence sichern. Ursache noch nicht behaupten.
Leite aus Metriken, Logs und Traces priorisierte Hypothesen ab. Notiere je Hypothese erwartetes Signal, sichere Prüfung und Ergebnis; ändere nur eine Variable zugleich.
Service stabil, Ursache reproduziert, Fix regressionsgetestet, Rollout beobachtet, Daten korrigiert und Follow-ups mit Owner und Termin versehen. Workaround und Root Cause bleiben getrennt.
Stabilisierung, Ursachenanalyse und dauerhafter Fix sind getrennte Entscheidungen. Ein schneller Workaround ist noch kein Root-Cause-Fix.