El deploy salió bien. La infraestructura no.
Publicado el 17 de agosto de 2026
𝗘𝗹 𝗱𝗲𝗽𝗹𝗼𝘆 𝘀𝗮𝗹𝗶𝗼́ 𝗯𝗶𝗲𝗻. 𝗟𝗮 𝗶𝗻𝗳𝗿𝗮𝗲𝘀𝘁𝗿𝘂𝗰𝘁𝘂𝗿𝗮 𝗻𝗼.
Una hora después del deploy, la instancia se quedó sin RAM. Los servicios que funcionaban perfectamente antes empezaron a caer, uno por uno. 😅
El nuevo servicio era concurrente y hacía peticiones HTTP. El problema: 𝗻𝘂𝗻𝗰𝗮 𝗰𝗲𝗿𝗿𝗮𝗯𝗮 𝗹𝗮𝘀 𝗰𝗼𝗻𝗲𝘅𝗶𝗼𝗻𝗲𝘀. Cada petición abría una nueva conexión y la dejaba ahí. La concurrencia las multiplicó hasta que la memoria colapsó y arrastró a todo lo que compartía la instancia. Lo viví en 𝗟𝘂𝗺𝗶𝗻𝗛𝗲𝗮𝗹𝘁𝗵 💻
¿Culpa del dev o del DevOps? 🔥
Respuesta honesta: de los dos.
El 𝗱𝗲𝘀𝗮𝗿𝗿𝗼𝗹𝗹𝗮𝗱𝗼𝗿 no gestionó el ciclo de vida de las conexiones → bug real.
El 𝗗𝗲𝘃𝗢𝗽𝘀 no aplicó límites de memoria al servicio → sin guardarrail, un servicio roto puede tumbar a sus vecinos.
Producción no es solo llevar código a la nube. Es un 𝗰𝗼𝗻𝘁𝗿𝗮𝘁𝗼 𝗱𝗲 𝗿𝗲𝘀𝗽𝗼𝗻𝘀𝗮𝗯𝗶𝗹𝗶𝗱𝗮𝗱 𝗰𝗼𝗺𝗽𝗮𝗿𝘁𝗶𝗱𝗮.
Desde ese incidente, mis deploys siempre incluyen:
✅ 𝗟𝗶́𝗺𝗶𝘁𝗲𝘀 de memoria y CPU por servicio
✅ 𝗛𝗲𝗮𝗹𝘁𝗵 𝗰𝗵𝗲𝗰𝗸𝘀 y restart policies
✅ 𝗠𝗼𝗻𝗶𝘁𝗼𝗿𝗲𝗼 de recursos antes del green light
Campeón, ¿has vivido un incidente así? ¿Quién asumió la responsabilidad en tu equipo? 👇
¡Sigan volando, Campeones! ✈️