La respuesta directa
Toda dependency crítica necesita failure contract: se inicia new payment, se lee state, se procesan callbacks, cómo se recupera. Depende del riesgo de duplicate execution y business impact.
Cuándo basta el enfoque actual
Direct provider puede ofrecer outage model más simple. Con un provider y cero tolerancia a intermediary failure, direct puede ser mejor.
Dónde empieza la presión
Sin degraded design teams improvisan retries/bypasses. Timeout no prueba que money no se movió.
Qué cambia con una capa de infraestructura
Durable idempotency, provider recovery, queues, circuit breakers y clear states permiten diseñar continuidad; algunos flows pueden tener emergency direct path.
El trade-off
Fallback paths agregan complexity y pueden ser untested shadow systems. No siempre son mejores que un short outage.
Cómo decidir
Define RPO, RTO y financial correctness por flow; simula fallos de layer/provider/network y decide availability vs certainty.
Cuándo encaja Zopio
Zopio encaja solo si customer acepta su papel en failure model y prueba degraded behavior.
Un siguiente paso práctico
Ejecuta game days y verifica messaging, state, provider lookup, reconciliation y recovery.
Define unavailable behavior antes de production.
Financial correctness puede superar availability.
Testea fallback igual que primary.
