Runbook Sammlung

Sammelwerk zur Enterprise-Master-Reihe. Markdown und HTML sind synchron erzeugt; technische Ordner bleiben stabil.

Dokument: Runbook-SammlungZielgruppe: Betrieb & EntwicklungNiveau: PraxisStatus: FreigegebenStand: 10.07.2026

Betriebs- und Runbook-Sammlung

Runbooks beschreiben, was bei Störungen konkret zu tun ist.

Incident AblaufAlarmTriageLogs/MetricsEindämmungRollback/RestorePostmortem

Runbooks

ProblemTypisches SymptomPrüfschritteBefehlLösung
App startet nichtContainer beendet sich sofortLogs prüfen, Env prüfen, Java-Version prüfendocker logs <container> / kubectl logs podImage und Konfiguration korrigieren
DB nicht erreichbarFalscher Host, Secret, NetworkPolicyDNS/Service/Secret prüfenkubectl get svc, kubectl describe podConfigMap/Secret/Policy korrigieren
Migration fehlgeschlagenSchema-Version oder SQL FehlerFlyway/Liquibase Logs prüfenmvn flyway:infoMigration reparieren, Backup nutzen
Outbox hängtPublisher läuft nicht oder Broker nicht erreichbarOutbox-Tabelle und Logs prüfenselect * from outbox_event where published=falsePublisher/Retry korrigieren
Route/Ingress geht nichtService Port oder TLS falschRoute, Service, Endpoints prüfenoc get route, oc get endpointsService-Port oder Route korrigieren
Storage vollPVC/Volume erreicht LimitVolume-Nutzung prüfendf -h, kubectl describe pvcRetention, Cleanup, Volume erweitern
Secret fehltDeployment referenziert Secret nicht vorhandenSecrets auflistenkubectl get secretSecret erstellen/extern binden
Health Check rotDependency oder App nicht bereitReadiness vs Liveness trennencurl /actuator/healthProbe oder Dependency reparieren
Rollback nötigRelease fehlerhaftletzte stabile Version ermittelnkubectl rollout undo deployment/appRollback ausführen, Incident dokumentieren

Merksatz

Ein gutes Runbook reduziert Stress: Es trennt Symptom, Ursache, Prüfung, Lösung und Prävention.

⌂ Cockpit