Blog · Nuvem
Uma falha de refrigeração na Virgínia deixou a Coinbase sem operar por horas
Em 8 de maio de 2026, a refrigeração de um data center da AWS em us-east-1, no norte da Virgínia, falhou e a Coinbase ficou fora do ar por várias horas. Em outubro de 2025, uma falha de DNS na mesma região tinha afetado 64 serviços internos da AWS e centenas de aplicações. Se todo o seu sistema vive em uma única zona de disponibilidade, a sua disponibilidade depende do que acontece nesses prédios.

O que aconteceu em 8 de maio
A AWS informou temperaturas internas elevadas em um dos seus data centers em us-east-1 por causa de uma falha no sistema de refrigeração. Localizou o problema em uma única zona de disponibilidade e redirecionou o tráfego para as outras zonas da região. A refrigeração adicional começou a funcionar umas duas horas depois dos primeiros relatos, mas uma atualização posterior avisou que reiniciar com segurança todos os sistemas afetados estava levando mais tempo do que o esperado.
A Coinbase confirmou que seus problemas vinham diretamente do evento da AWS e, depois de várias horas com os mercados degradados, informou que tudo voltava a operar. A recomendação da AWS durante o incidente foi a de sempre: os clientes da zona afetada tinham que fazer failover para outra zona.
A mesma região, sete meses antes
Em 20 de outubro de 2025, um problema de DNS em us-east-1 afetou 64 serviços internos da AWS. Snapchat, Reddit, Zoom, Venmo, Robinhood e também a Coinbase tiveram problemas. O Downdetector recebeu mais de 6,5 milhões de relatos sobre mais de 1.000 empresas.
As duas falhas são diferentes. A de maio ficou restrita a uma zona: quem tinha o sistema distribuído em várias zonas conseguiu seguir operando. A de outubro atingiu um serviço da região inteira: aí distribuir entre zonas não basta, e o que protege é ter o que é crítico preparado para funcionar em outra região.
O que uma zona de disponibilidade cobre
Uma zona é um grupo de um ou mais data centers com energia, refrigeração e rede independentes das outras zonas da região. Ela foi pensada para que a falha de uma zona não arraste as outras. O failover funciona se você já estava lá: réplicas do banco em outra zona, capacidade suficiente para absorver o tráfego e uma troca testada com antecedência. Se não, a recomendação da AWS chega tarde.