Runbook Sammlung
Sammelwerk zur Enterprise-Master-Reihe. Markdown und HTML sind synchron erzeugt; technische Ordner bleiben stabil.
Betriebs- und Runbook-Sammlung
Runbooks beschreiben, was bei Störungen konkret zu tun ist.
Runbooks
| Problem | Typisches Symptom | Prüfschritte | Befehl | Lösung |
|---|---|---|---|---|
| App startet nicht | Container beendet sich sofort | Logs prüfen, Env prüfen, Java-Version prüfen | docker logs <container> / kubectl logs pod | Image und Konfiguration korrigieren |
| DB nicht erreichbar | Falscher Host, Secret, NetworkPolicy | DNS/Service/Secret prüfen | kubectl get svc, kubectl describe pod | ConfigMap/Secret/Policy korrigieren |
| Migration fehlgeschlagen | Schema-Version oder SQL Fehler | Flyway/Liquibase Logs prüfen | mvn flyway:info | Migration reparieren, Backup nutzen |
| Outbox hängt | Publisher läuft nicht oder Broker nicht erreichbar | Outbox-Tabelle und Logs prüfen | select * from outbox_event where published=false | Publisher/Retry korrigieren |
| Route/Ingress geht nicht | Service Port oder TLS falsch | Route, Service, Endpoints prüfen | oc get route, oc get endpoints | Service-Port oder Route korrigieren |
| Storage voll | PVC/Volume erreicht Limit | Volume-Nutzung prüfen | df -h, kubectl describe pvc | Retention, Cleanup, Volume erweitern |
| Secret fehlt | Deployment referenziert Secret nicht vorhanden | Secrets auflisten | kubectl get secret | Secret erstellen/extern binden |
| Health Check rot | Dependency oder App nicht bereit | Readiness vs Liveness trennen | curl /actuator/health | Probe oder Dependency reparieren |
| Rollback nötig | Release fehlerhaft | letzte stabile Version ermitteln | kubectl rollout undo deployment/app | Rollback ausführen, Incident dokumentieren |
Merksatz
Ein gutes Runbook reduziert Stress: Es trennt Symptom, Ursache, Prüfung, Lösung und Prävention.