JEnterprise Senior Java Workbench
Senior Java · Fachbereich

Observability & Diagnostics

Logs, Metriken und Traces als zusammenhängendes Diagnosemodell mit fachlichem Kontext. Nutze die Seite für eine konkrete Engineering-Aufgabe: Kläre zuerst Ziel und Risiko und halte danach Ergebnis, Nachweis und nächsten Schritt fest.

Zur Übersicht

Arbeitsauftrag

Wann verwenden?

Wenn ein Systemverhalten in Produktion erklärt oder eine Änderung messbar abgesichert werden muss.

Nicht dafür verwenden

Nicht zum wahllosen Sammeln von Logs und Metriken ohne konkrete Diagnosefrage.

Definition of Done

SLI und Kontext sind definiert; Logs, Metriken und Traces korrelieren; Alarm und Runbook führen zu einer Handlung.

Telemetry aus Diagnosefragen ableiten
Correlation über Servicegrenzen erhalten
Symptome systematisch bis zur Ursache verfolgen

Signal nach Diagnosefrage

Signal Beantwortet Guter Kontext Antipattern
Metrik wie oft und wie stark? Service, Route, Ergebnis unbegrenzte IDs als Label
Log was ist konkret passiert? Trace-ID und fachlicher Schlüssel Stacktrace ohne Handlung
Trace wo ging Zeit oder Fehler entlang? Span, Abhängigkeit, Status 100 Prozent Sampling ohne Zweck
Strukturierte Logs

Ein Logeintrag beschreibt Ereignis, Ergebnis und Kontext. Freitext bleibt lesbar, strukturierte Felder erlauben Filterung und Korrelation.

Fehler werden einmal an der richtigen Grenze mit Stacktrace geloggt, nicht in jeder Schicht erneut.

JSON
{
  "level": "WARN",
  "event": "order.rejected",
  "orderId": "ord-4711",
  "reason": "CREDIT_LIMIT",
  "traceId": "b7ad...",
  "durationMs": 37
}
Metriken

Technische Metriken zeigen Ressourcen und Fehler. Fachliche Metriken zeigen, ob der Geschäftsprozess funktioniert. Beide benötigen klare Einheiten und dimensionsarme Labels.

Unbegrenzte IDs als Metric Labels führen zu hoher Kardinalität und unkontrollierbaren Kosten.

Tracing

Traces zeigen zeitliche Abhängigkeiten über Services, Datenbanken und Broker. Sie ersetzen weder Logs noch Metriken, sondern verbinden konkrete Anfragen mit Systemverhalten.

Praxisartefakt · Diagnosepfad

Alarm
Checkout p95 länger als 800 ms über zehn Minuten.
Dashboard
Rate, Errors, Duration und Saturation mit Release-Markierung.
Trace
Langsamster Span zeigt Inventory Batch Lookup.
Log
Trace-ID, OrderId und Ergebnis ohne personenbezogene Nutzdaten.
Runbook
Stabilisierung, Gegenprobe, Eskalation und Rollbackkriterium.
⌂ Cockpit