Blog · Nube
Una falla de refrigeración en Virginia dejó a Coinbase sin operar durante horas
El 8 de mayo de 2026 falló la refrigeración de un data center de AWS en us-east-1, en el norte de Virginia, y Coinbase quedó fuera de línea varias horas. En octubre de 2025, una falla de DNS en la misma región había afectado 64 servicios internos de AWS y a cientos de aplicaciones. Si todo tu sistema vive en una sola zona de disponibilidad, tu disponibilidad depende de lo que pase en esos edificios.

Qué pasó el 8 de mayo
AWS informó temperaturas internas elevadas en uno de sus centros de datos de us-east-1 por una falla en el sistema de refrigeración. Ubicó el problema en una única zona de disponibilidad y redirigió el tráfico a las otras zonas de la región. La refrigeración adicional empezó a funcionar un par de horas después de los primeros reportes, pero una actualización posterior avisó que reiniciar de forma segura todos los sistemas afectados estaba llevando más tiempo del esperado.
Coinbase confirmó que sus problemas venían directamente del evento de AWS y, después de varias horas con los mercados degradados, informó que todo volvía a operar. La recomendación de AWS durante el incidente fue la de siempre: los clientes de la zona afectada tenían que hacer failover a otra zona.
La misma región, siete meses antes
El 20 de octubre de 2025, un problema de DNS en us-east-1 afectó 64 servicios internos de AWS. Tuvieron problemas Snapchat, Reddit, Zoom, Venmo, Robinhood y también Coinbase. Downdetector recibió más de 6,5 millones de reportes sobre más de 1.000 empresas.
Las dos fallas son distintas. La de mayo quedó en una zona: quien tenía su sistema repartido en varias pudo seguir. La de octubre golpeó un servicio de toda la región: ahí repartir entre zonas no alcanza, y lo que protege es tener lo crítico preparado para funcionar en otra región.
Qué cubre una zona de disponibilidad
Una zona es un grupo de uno o más centros de datos con energía, refrigeración y red independientes de las demás zonas de la región. Está pensada para que la falla de una no arrastre a las otras. El failover funciona si ya estabas ahí: réplicas de la base en otra zona, capacidad suficiente para absorber el tráfico y un cambio probado de antemano. Si no, la recomendación de AWS llega tarde.