Na nuvem, projetamos assumindo que falhas acontecem. Por isso, distribuímos componentes em zonas/regiões e usamos bancos e filas gerenciados.
O objetivo é manter o sistema de pé mesmo com incidentes locais, garantindo SLOs realistas e rollback rápido.
- Multi-AZ, replicação síncrona/assíncrona.
- Failover automático e health checks.
- Topology aware routing e circuit breakers.
- Backups testados e DR com RTO/RPO definidos.
- Chaos testing para validar hipóteses.
Disponibilidade é arquitetura + prática contínua.