← Zurück

Messaging Runbook Messaging-Fehlerbetrieb

  1. Lag prüfen: total, pro Partition und pro Consumer-Gruppe.
  2. DLQ-Samples lesen, nicht nur Anzahl betrachten.
  3. Fehler klassifizieren: transient, fachlich temporär, fachlich final, Bug, Poison Message, Duplikat.
  4. Retry-Sturm stoppen: Backoff erhöhen, Rate limitieren, Downstream schützen.
  5. Reprocessing erst nach Fix starten und mit kleinem Fenster beginnen.
  6. Danach Metriken vergleichen und Incident dokumentieren.
⌂ Cockpit