Cuando una pyme escucha "observabilidad" piensa en Datadog, Grafana, OpenTelemetry y un equipo dedicado. La conversación termina ahí. Pero la observabilidad básica cuesta poco y resuelve problemas caros.
Qué es lo mínimo viable
Tres cosas:
- Logs estructurados por request, con un identificador de correlación.
- Métricas de latencia, tasa de error y uso por endpoint.
- Alertas cuando la tasa de error supera un umbral o la latencia p95 se degrada.
Con esto se resuelve el 80% de los problemas operativos que afectan a una pyme.
Por qué la pyme lo necesita igual
El argumento "somos chicos, no nos pasa" no se sostiene. Cuando un sistema tiene tres usuarios y se cae, los tres usuarios se caen al mismo tiempo. Cuando un proveedor externo cambia una API y nadie lo sabe, el sistema entero queda fuera sin que haya error visible.
La observabilidad mínima cuesta menos que una hora de soporte externo cuando algo falla sin contexto.
Lo que NO se necesita
- Telemetría distribuida con 12 servicios y OpenTelemetry completo.
- Un cluster de Prometheus con HA y retención de un año.
- Un equipo SRE dedicado.
Eso es para plataformas con cientos de microservicios y miles de requests por segundo. Para una pyme, un servicio de logs SaaS con plan básico y un panel de métricas simple basta.
Cómo implementarlo en una semana
1. Instrumentar el código para emitir logs estructurados y métricas por endpoint.
2. Conectar a un servicio SaaS (Datadog, New Relic, Grafana Cloud, Better Stack).
3. Definir tres alertas mínimas: error rate, latencia, caída total del servicio.
4. Documentar el runbook de respuesta.
Cierre
La observabilidad mínima no es un lujo. Es higiene operativa. Una pyme que invierte una semana en esto gana meses de tiempo perdido en debugging.
En CodeHub dejamos cada producto que construimos con observabilidad básica habilitada desde el día uno. No como feature, como disciplina.