← Volver al blog

Post-mortems sin culpa: construyendo una cultura madura de incidentes

El equipo que castiga la falla aprende a esconder la falla. El error silenciado hoy se convierte en la caída visible ante el cliente del trimestre siguiente, con un costo muy superior al incidente original. Las investigaciones de confiabilidad repiten el hallazgo: el miedo reduce los reportes, y menos reportes significan menos chance de corregir temprano. El post-mortem blameless transforma cada falla en defensa contra su repetición.

Por qué culpar sale caro

La economía del miedo cierra rápido: el ingeniero castigado omite el siguiente error, las fallas escondidas se acumulan y la explosión llega a producción un domingo. La empresa con cultura de culpa descubre el incidente por la queja del cliente, no por el monitor, y el tiempo de detección salta de minutos a días. El blame busca culpable; el blameless examina las condiciones que permitieron el error, la alerta que no disparó, el runbook incompleto, el review hecho a las carreras. La responsabilidad sigue existiendo, a nivel sistémico.

El modelo de documento que funciona

  • Línea de tiempo desde el primer detonante hasta la resolución, con horas reales.
  • Lista de factores contribuyentes, sin nombres de personas.
  • Sección de "qué funcionó bien"; cortarla convierte el reporte en un dossier de errores.
  • Acciones con responsable, plazo y ticket, seguidas hasta el cierre.

La disciplina de las acciones decide la credibilidad del programa. Un post-mortem cuyas acciones nunca salen enseña al equipo que la ceremonia es teatro, y la participación cae en el tercer documento. Prueba de cordura: releer cada documento seis meses después y verificar la tasa de conclusión de las acciones; por debajo de 70%, el ritual está vacío.

Severidad con criterio objetivo

Define S1 a S4 con umbrales de impacto en el cliente: usuarios afectados, ingreso por minuto parado, datos en riesgo. La clasificación determina page versus ticket, SLA de respuesta y obligatoriedad de post-mortem. Sin criterio escrito, cada incidente se vuelve una negociación de ego en el peor momento posible.

Entrenamiento antes del incendio real

Los game days y los ejercicios de caos exponen al equipo a fallas simuladas antes de que lleguen un sábado por la noche. Los equipos que ensayan dos veces al año reducen el tiempo de recuperación porque conocen el runbook de memoria. Revisa los post-mortems del mes en búsqueda de patrones: el mismo factor contribuyente en tres incidentes indica inversión estructural en confiabilidad.

El comportamiento del liderazgo en la sala

El ejecutivo que pregunta "quién hizo esto" termina con el programa ahí mismo; el equipo registra la lección y vuelve a esconder errores. Los líderes modelan curiosidad sobre los sistemas: qué condiciones produjeron la falla, qué la hizo probable, qué bloquea la siguiente. Una cultura madura de incidentes nace de ese tipo de pregunta.

¿Enfrentando este desafío en tu empresa?

Ayudo a CTOs y equipos de ingeniería a resolver problemas como este — con diagnóstico honesto y ejecución enfocada.

Agendar una conversación
Marc Reinan Gomes
Marc Reinan Gomes Staff Engineer & Consultor

Más de 14 años construyendo productos, liderando equipos de ingeniería y ayudando empresas a escalar con calidad técnica.

Compartir en LinkedIn