Navigation
Tool / Betriebsframework

Observability, Monitoring, Logging und Tracing

Observability beantwortet nicht nur ob ein System läuft, sondern warum es langsam, fehlerhaft oder fachlich beeinträchtigt ist.

Diagramm Observability, Monitoring, Logging und Tracing

Fachliches Bild

Wenn Bestellungen hängen, zählt nicht nur CPU-Auslastung. Entscheidend ist: Wie viele Kunden sind betroffen? Welche Funktion ist gestört? Seit wann? Welche Änderung korreliert mit dem Fehler?

Vier Signale

Metriken zeigen Trends und Zustände. Logs erklären Ereignisse. Traces zeigen verteilte Abläufe. Events zeigen Infrastruktur- und Plattformänderungen. Zusammen ermöglichen sie Ursachenanalyse.

SLI, SLO, SLA

SLI ist eine Messgröße, zum Beispiel Erfolgsrate. SLO ist ein internes Ziel, etwa 99,9 Prozent erfolgreiche Checkout-Anfragen. SLA ist eine externe Verpflichtung mit Konsequenzen.

Alerting

Ein guter Alarm ist handlungsorientiert. Er hat Schweregrad, Symptom, betroffene Komponente, mögliche Ursache, Dashboard-Link und Runbook.

Korrelation

Moderne Enterprise-Systeme sind verteilt. Eine Request-ID oder Trace-ID muss durch Gateway, Service, Messaging und Datenbank sichtbar bleiben.

Ausführliche Beispiele

Prometheus Alert Rule

groups:
  - name: order-api.rules
    rules:
      - alert: OrderApiHighErrorRate
        expr: rate(http_server_requests_seconds_count{app="order-api",status=~"5.."}[5m])
              / rate(http_server_requests_seconds_count{app="order-api"}[5m]) > 0.03
        for: 10m
        labels:
          severity: warning
          service: order-api
        annotations:
          summary: "Order API Fehlerquote ueber 3 Prozent"
          runbook_url: "https://runbooks.example.com/order-api/high-error-rate"

Log-Konvention

{
  "timestamp": "2026-07-07T12:00:00Z",
  "level": "ERROR",
  "service": "order-api",
  "traceId": "7c2e2f2f5f1",
  "customerImpact": "checkout_failed",
  "orderId": "O-4711",
  "message": "Payment authorization timed out"
}

SLO-Karte

slo:
  service: order-api
  user_journey: checkout
  objective: "99.9% erfolgreiche Checkout-Anfragen pro Monat"
  sli: "successful_checkout_requests / total_checkout_requests"
  error_budget_policy:
    burn_rate_fast: page_on_call
    burn_rate_slow: create_improvement_task

Typische Stolperfallen

  • Zu viele Alarme ohne Runbook.
  • Metriken sind vorhanden, aber nicht fachlich interpretiert.
  • Logs enthalten keine Korrelations-ID.
  • Tracing endet am ersten Service.
  • Dashboards werden gebaut, aber nicht gepflegt.

Prüf- und Verständnis-Checkliste

  • SLIs und SLOs sind definiert.
  • Alarme sind handlungsorientiert.
  • Logs haben Struktur und Trace-ID.
  • Dashboards zeigen technische und fachliche Sicht.
  • Runbooks sind mit Alarmen verlinkt.

Merksatz

Eine Infrastrukturkomponente ist erst enterprise-tauglich, wenn sie geplant, automatisiert, überwacht, geschützt, wiederherstellbar und fachlich begründet ist.