Buscamos sumar un/a SRE Observability & Reliability SR para formar parte de una importante empresa del ecosistema de medios de pago, con foco en la confiabilidad, observabilidad y disponibilidad de servicios críticos.
Tu rol será clave para construir y consolidar las capacidades de Site Reliability Engineering de la organización, definiendo estándares de observabilidad, monitoreo y alertamiento, trabajando sobre la disponibilidad y performance de los servicios y promoviendo la automatización y mejora continua.
Lo que valoramos de tu perfil
- Pensamiento sistémico y visión end-to-end.
- Capacidad analítica para interpretar métricas, logs y trazas e identificar desvíos.
- Proactividad, autonomía y orientación a la mejora continua.
- Capacidad para resolver problemas complejos y trabajar sobre incidentes productivos.
- Orientación a la automatización y eliminación de tareas repetitivas.
- Buenas habilidades de comunicación y capacidad para trabajar con equipos técnicos y de negocio.
- Capacidad para influir y promover estándares técnicos en equipos multidisciplinarios.
Tus principales desafíos serán
- Definir y evolucionar prácticas y estándares de Site Reliability Engineering para servicios críticos.
- Definir y mantener SLIs, SLOs y Error Budgets, estableciendo métricas objetivas de confiabilidad.
- Diseñar y mantener estándares de observabilidad, incluyendo logs, métricas, trazas y health checks.
- Diseñar y optimizar esquemas de alertamiento, definiendo severidades, thresholds, routing, escalamiento y acciones esperadas.
- Identificar y reducir alertas no accionables y ruido operativo.
- Construir y mantener dashboards de monitoreo y fuentes de información sobre plataformas centralizadas de observabilidad.
- Elaborar, probar y mantener runbooks para diagnóstico, mitigación y recuperación de incidentes.
- Analizar incidentes y oportunidades de mejora, trabajando sobre MTTD, MTTR, disponibilidad y resiliencia.
- Identificar riesgos de confiabilidad, puntos únicos de falla, problemas recurrentes y oportunidades de automatización.
- Construir y priorizar un Reliability Engineering Backlog, transformando incidentes y riesgos en iniciativas concretas de mejora.
- Definir y validar criterios de Reliability Readiness para garantizar que los servicios lleguen a producción con la instrumentación, monitoreo y alertamiento necesarios.
- Trabajar en conjunto con equipos de Desarrollo, Cloud, Infraestructura, Plataforma, Producto, Operaciones e Incident Management.
- Participar en procesos de transición e internalización de servicios, asegurando la continuidad de la observabilidad y el monitoreo.
¿Qué esperamos de vos?
- Experiencia comprobable como Site Reliability Engineer (SRE).
- Experiencia trabajando sobre sistemas productivos críticos, disponibilidad y confiabilidad de servicios.
- Sólidos conocimientos de observabilidad, incluyendo logs, métricas, trazas distribuidas y health checks.
- Experiencia en estándares de instrumentación y telemetría, utilizando OpenTelemetry o tecnologías equivalentes.
- Experiencia con herramientas de observabilidad como Grafana, Prometheus, Datadog, Dynatrace, Elastic o similares.
- Experiencia definiendo y trabajando con SLI, SLO, SLA y Error Budget.
- Experiencia en diseño y gestión de alertas, thresholds, severidades, escalamiento y reducción de alertas no accionables.
- Experiencia en análisis y resolución de incidentes, incluyendo RCA (Root Cause Analysis) y métricas como MTTD y MTTR.
- Experiencia trabajando con arquitecturas de microservicios, contenedores y ambientes Cloud.
- Sólidos conocimientos de AWS.
- Experiencia trabajando con Kubernetes y Docker.
- Conocimientos de Linux.
- Experiencia en scripting y automatización, preferentemente con Python, Bash o similares.
- Conocimientos de Infrastructure as Code, preferentemente Terraform.
- Conocimientos de CI/CD y herramientas de integración y deployment.
- Conocimientos de SQL y capacidad para analizar datos asociados a indicadores de servicio.
- Formación universitaria o terciaria en Sistemas, Informática, Tecnología o carreras afines será valorada.
¿Qué ofrece el cliente?
- Relación de dependencia directa con empresa líder en soluciones de pagos.
- Modalidad híbrida (CABA)
- 30 días al año de trabajo remoto desde cualquier parte del mundo.
- Bono anual por performance + revisión salarial periódica.
- Reintegro mensual de internet y crédito en plataformas de delivery.
- Prepaga de primer nivel para vos y tu grupo familiar.
- Días hábiles de vacaciones + licencias extendidas de familia.
- Acceso a formación continua, certificaciones y convenios educativos.
- Espacios de trabajo atractivos y tecnológicos.