Ziel
Das Projekt beschreibt, wie das System nach Ausfall, Datenverlust oder fehlerhaftem Release wiederhergestellt wird.
Kritische Wiederherstellungsobjekte
| Objekt | Warum kritisch | Wiederherstellung |
|---|---|---|
| PostgreSQL Datenbank | Orders, Outbox, Flyway History | Restore aus Backup |
| RabbitMQ Queues | laufende Events | Replay aus Outbox |
| Keycloak Realm | Rollen, Clients, User | Realm JSON importieren |
| Container Images | Runtime Deployment | CI/CD Artefakt oder Rebuild |
| Konfiguration | Secrets, URLs, Profile | Git + Secret Store |
RTO / RPO Modell
| Klasse | Bedeutung | Zielwert im Lab |
|---|---|---|
| RTO | Zeit bis Wiederherstellung | 60 Minuten |
| RPO | maximal tolerierter Datenverlust | 15 Minuten |
DR Ablauf
- Incident klassifizieren.
- Schreibzugriffe stoppen.
- Letztes valides Backup bestimmen.
- Restore in isolierter Umgebung testen.
- Produktionsrestore ausführen.
- Outbox Backlog prüfen.
- RabbitMQ Events aus Outbox erneut publizieren.
- Smoke Tests ausführen.
- Monitoring prüfen.
- Incident dokumentieren.