A · Serviceziel
- kritische User Journey beschreiben
- Good Event und Valid Event definieren
- SLO und Fehlerbudget berechnen
Das Lab entwirft ein vollständiges, offline nachvollziehbares Reliability-Modell. Es führt keine Befehle automatisch aus und arbeitet ohne produktive Secrets.
Formuliere ein fachliches Checkout-SLI. Der Nenner enthält nur valide gestartete Checkout-Versuche; der Zähler nur innerhalb des Zielzeitfensters erfolgreich abgeschlossene Vorgänge. Begründe Ausschlüsse.
SLO = 99.9 % erfolgreiche Checkout-Abschlüsse in 30 Tagen
Error Budget = 0.1 % der validen Checkout-Versuche
Fast burn = akute starke Verletzung
Slow burn = anhaltende schleichende VerletzungNutze die mitgelieferte Collector-Konfiguration. Prüfe, an welcher Stelle PII entfernt, Batches gebildet, Speicher begrenzt und Tail Sampling angewendet wird.
Jeder Paging Alert benötigt Benutzerwirkung, Severity, Owner, Dashboard, Runbook und eine eindeutige erste Diagnosehandlung. Ein Alert ohne konkrete Handlung bleibt Ticket oder Dashboard-Signal.