Disaster Recovery Konzept

← Zurueck zum Index

Ziel

Das Projekt beschreibt, wie das System nach Ausfall, Datenverlust oder fehlerhaftem Release wiederhergestellt wird.

Kritische Wiederherstellungsobjekte
ObjektWarum kritischWiederherstellung
PostgreSQL DatenbankOrders, Outbox, Flyway HistoryRestore aus Backup
RabbitMQ Queueslaufende EventsReplay aus Outbox
Keycloak RealmRollen, Clients, UserRealm JSON importieren
Container ImagesRuntime DeploymentCI/CD Artefakt oder Rebuild
KonfigurationSecrets, URLs, ProfileGit + Secret Store
RTO / RPO Modell
KlasseBedeutungZielwert im Lab
RTOZeit bis Wiederherstellung60 Minuten
RPOmaximal tolerierter Datenverlust15 Minuten
DR Ablauf
  1. Incident klassifizieren.
  2. Schreibzugriffe stoppen.
  3. Letztes valides Backup bestimmen.
  4. Restore in isolierter Umgebung testen.
  5. Produktionsrestore ausführen.
  6. Outbox Backlog prüfen.
  7. RabbitMQ Events aus Outbox erneut publizieren.
  8. Smoke Tests ausführen.
  9. Monitoring prüfen.
  10. Incident dokumentieren.
⌂ Cockpit