Praxis-Lab

SRE Reliability Engineering für den CommerceOne-Checkout

Das Lab entwirft ein vollständiges, offline nachvollziehbares Reliability-Modell. Es führt keine Befehle automatisch aus und arbeitet ohne produktive Secrets.

A · Serviceziel

  1. kritische User Journey beschreiben
  2. Good Event und Valid Event definieren
  3. SLO und Fehlerbudget berechnen

B · Telemetrie

  1. Resource Attributes festlegen
  2. Collector-Prozessoren wählen
  3. Cardinality und Redaction prüfen

C · Betrieb

  1. Burn-Rate Alert definieren
  2. Runbook und Eskalation verknüpfen
  3. Service Level Review vorbereiten
Aufgabe 1: SLI und SLO

Formuliere ein fachliches Checkout-SLI. Der Nenner enthält nur valide gestartete Checkout-Versuche; der Zähler nur innerhalb des Zielzeitfensters erfolgreich abgeschlossene Vorgänge. Begründe Ausschlüsse.

SLO = 99.9 % erfolgreiche Checkout-Abschlüsse in 30 Tagen
Error Budget = 0.1 % der validen Checkout-Versuche
Fast burn = akute starke Verletzung
Slow burn = anhaltende schleichende Verletzung
Aufgabe 2: Telemetry Pipeline

Nutze die mitgelieferte Collector-Konfiguration. Prüfe, an welcher Stelle PII entfernt, Batches gebildet, Speicher begrenzt und Tail Sampling angewendet wird.

OTel-Collector-Konfiguration

Aufgabe 3: Alert und Runbook

Jeder Paging Alert benötigt Benutzerwirkung, Severity, Owner, Dashboard, Runbook und eine eindeutige erste Diagnosehandlung. Ein Alert ohne konkrete Handlung bleibt Ticket oder Dashboard-Signal.

Prometheus Rules · Checkout Runbook

Abnahmefragen
Abschlusskriterium: Ziel, Signal, Datenpfad, Alert, Owner, Runbook, Kosten- und Datenschutzgrenze sowie Review-Entscheidung sind konsistent miteinander verbunden.
⌂ Cockpit