← Volver a cápsulas
DevOps AWS AutoScaling CloudComputing Backend

Mi servidor de producción se cayó y yo ni me enteré

Publicado el 30 de julio de 2026

𝗠𝗶 𝘀𝗲𝗿𝘃𝗶𝗱𝗼𝗿 𝗱𝗲 𝗽𝗿𝗼𝗱𝘂𝗰𝗰𝗶ó𝗻 𝘀𝗲 𝗰𝗮𝘆ó 𝘆 𝘆𝗼 𝗻𝗶 𝗺𝗲 𝗲𝗻𝘁𝗲𝗿é 🚀

Una instancia de producción murió a las 19:21 UTC. Nadie me llamó, no sonó ninguna alarma de pánico, no perdí la noche. 😅

Cuando entré a revisar, 𝗔𝗪𝗦 ya había hecho el trabajo por mí: el 𝗔𝘂𝘁𝗼 𝗦𝗰𝗮𝗹𝗶𝗻𝗴 𝗚𝗿𝗼𝘂𝗽 detectó que el host físico falló — los status checks de System e Instance cayeron juntos, la firma clásica de un problema de hardware de AWS y no mío — y en minutos ya había lanzado una instancia nueva para reemplazarla. 💪

Eso es 𝘀𝗲𝗹𝗳-𝗵𝗲𝗮𝗹𝗶𝗻𝗴: la infraestructura se cura sola.

Pero aquí viene lo que 𝗿𝗲𝗮𝗹𝗺𝗲𝗻𝘁𝗲 aprendí 👇

El ASG reemplazó la máquina de manera impecable… pero el 𝗯𝗼𝗼𝘁𝘀𝘁𝗿𝗮𝗽 de la instancia nueva no estaba preparado para levantarse 100% solo. El verdadero punto débil nunca fue la caída — para eso justamente existe el ASG. El punto débil era mi script de arranque. 💻

La lección: 𝗮𝗹𝘁𝗮 𝗱𝗶𝘀𝗽𝗼𝗻𝗶𝗯𝗶𝗹𝗶𝗱𝗮𝗱 no es solo reemplazar lo que se rompe. Es que lo nuevo se levante entero, solo, sin que tengas que tocar nada de madrugada. 🔥

¿Ustedes ya probaron tumbar una instancia a propósito para ver si su infra se recupera sola?

¡Sigan volando, Campeones! ✈️