Cómo un líder del retail rompió las barreras del escalado vertical, logrando una monitorización resiliente para más de un millón de métricas y reduciendo costes operativos.
Situación inicial y contexto
Un gigante internacional del sector retail operaba su infraestructura crítica sobre una arquitectura Cloud Native basada en Google Kubernetes Engine (GKE) y microservicios. Su ecosistema de observabilidad centralizaba la gestión de alertas en una instancia única y masiva de Prometheus.
El crecimiento exponencial del negocio llevó esta arquitectura al límite. Con un volumen de más de 400.000 series de métricas activas en su clúster principal, la organización se enfrentaba a barreras de escalado vertical tanto físicas como financieras. Esta dependencia de una sola instancia representaba un riesgo crítico: cualquier fallo en la réplica principal implicaba la pérdida total de visibilidad operativa y posibles interrupciones en el servicio.
¿Cual era la necesidad?
Para garantizar la estabilidad de sus operaciones digitales y optimizar recursos, la compañía necesitaba evolucionar hacia una arquitectura distribuida. Los objetivos clave eran:
- Escalabilidad a futuro: Preparar la infraestructura para soportar un crecimiento proyectado superior a 1 millón de métricas.
- Eficiencia de recursos: Eliminar el desperdicio de capacidad en los nodos de Kubernetes provocado por el sobredimensionamiento de una única instancia.
- Flexibilidad de datos: Capacidad para gestionar diferentes políticas de retención de datos a largo plazo y reducir la dependencia de logs costosos en favor de métricas más ligeras.
Cómo se implementó la solución
Datadope ejecutó la transición desde un modelo monolítico hacia una arquitectura de escalado horizontal en más de 10 clústeres de Kubernetes. La solución técnica incluyó:
- Arquitectura Prometheus + Thanos: Despliegue de múltiples instancias de Prometheus combinadas con el stack completo de Thanos (Sidecar, Compact y Store). Esto permitió descentralizar la ingesta manteniendo una visión global unificada y almacenamiento eficiente a largo plazo.
- Aceleración con Redis: Integración de Redis para el cacheo de series temporales, optimizando el rendimiento de las consultas y reduciendo la latencia de búsqueda.
- Estandarización operativa: Definición de nuevas políticas de etiquetado (labeling) y despliegue de un sistema de self-service para la gestión de alertas, empoderando a los equipos de desarrollo y asegurando la gobernanza de datos.
Resultados y beneficios
La transformación de la arquitectura de observabilidad generó un impacto inmediato en la eficiencia técnica y económica de la organización:
- Ahorro directo de infraestructura: La optimización de recursos permitió liberar cerca de 10 nodos dedicados de Kubernetes, resultando en un ahorro mensual de miles de euros.
- Mejora de rendimiento: Los tiempos de búsqueda de datos se redujeron en un 15%, mientras que el consumo de memoria de las instancias de Prometheus disminuyó un 10%.
- Capacidad multiplicada: El sistema quedó certificado para escalar por encima de 1 millón de métricas, triplicando su capacidad original sin comprometer la estabilidad.
- Eficiencia en licenciamiento SaaS: La nueva capacidad de métricas permite reducir la ingesta de logs en plataformas de terceros, con un ahorro potencial estimado de entre un 10%-30% anuales.
- Resiliencia total: Se eliminó el punto único de fallo, garantizando alta disponibilidad mediante la distribución de carga entre múltiples réplicas.