Observability, Monitoring, Logging und Tracing
Observability beantwortet nicht nur ob ein System läuft, sondern warum es langsam, fehlerhaft oder fachlich beeinträchtigt ist.
Fachliches Bild
Wenn Bestellungen hängen, zählt nicht nur CPU-Auslastung. Entscheidend ist: Wie viele Kunden sind betroffen? Welche Funktion ist gestört? Seit wann? Welche Änderung korreliert mit dem Fehler?
Vier Signale
Metriken zeigen Trends und Zustände. Logs erklären Ereignisse. Traces zeigen verteilte Abläufe. Events zeigen Infrastruktur- und Plattformänderungen. Zusammen ermöglichen sie Ursachenanalyse.
SLI, SLO, SLA
SLI ist eine Messgröße, zum Beispiel Erfolgsrate. SLO ist ein internes Ziel, etwa 99,9 Prozent erfolgreiche Checkout-Anfragen. SLA ist eine externe Verpflichtung mit Konsequenzen.
Alerting
Ein guter Alarm ist handlungsorientiert. Er hat Schweregrad, Symptom, betroffene Komponente, mögliche Ursache, Dashboard-Link und Runbook.
Korrelation
Moderne Enterprise-Systeme sind verteilt. Eine Request-ID oder Trace-ID muss durch Gateway, Service, Messaging und Datenbank sichtbar bleiben.
Ausführliche Beispiele
Prometheus Alert Rule
groups:
- name: order-api.rules
rules:
- alert: OrderApiHighErrorRate
expr: rate(http_server_requests_seconds_count{app="order-api",status=~"5.."}[5m])
/ rate(http_server_requests_seconds_count{app="order-api"}[5m]) > 0.03
for: 10m
labels:
severity: warning
service: order-api
annotations:
summary: "Order API Fehlerquote ueber 3 Prozent"
runbook_url: "https://runbooks.example.com/order-api/high-error-rate"
Log-Konvention
{
"timestamp": "2026-07-07T12:00:00Z",
"level": "ERROR",
"service": "order-api",
"traceId": "7c2e2f2f5f1",
"customerImpact": "checkout_failed",
"orderId": "O-4711",
"message": "Payment authorization timed out"
}
SLO-Karte
slo:
service: order-api
user_journey: checkout
objective: "99.9% erfolgreiche Checkout-Anfragen pro Monat"
sli: "successful_checkout_requests / total_checkout_requests"
error_budget_policy:
burn_rate_fast: page_on_call
burn_rate_slow: create_improvement_task
Typische Stolperfallen
- Zu viele Alarme ohne Runbook.
- Metriken sind vorhanden, aber nicht fachlich interpretiert.
- Logs enthalten keine Korrelations-ID.
- Tracing endet am ersten Service.
- Dashboards werden gebaut, aber nicht gepflegt.
Prüf- und Verständnis-Checkliste
- SLIs und SLOs sind definiert.
- Alarme sind handlungsorientiert.
- Logs haben Struktur und Trace-ID.
- Dashboards zeigen technische und fachliche Sicht.
- Runbooks sind mit Alarmen verlinkt.
Merksatz
Eine Infrastrukturkomponente ist erst enterprise-tauglich, wenn sie geplant, automatisiert, überwacht, geschützt, wiederherstellbar und fachlich begründet ist.