Oferta de Empleo

ChatGPT Image 14 sept 2026, 10_31_41

SRE Observability & Reliability SR – AMBA

Facebook
Twitter
LinkedIn
WhatsApp

Buscamos sumar un/a SRE Observability & Reliability SR para formar parte de una importante empresa del ecosistema de medios de pago, con foco en la confiabilidad, observabilidad y disponibilidad de servicios críticos.

Tu rol será clave para construir y consolidar las capacidades de Site Reliability Engineering de la organización, definiendo estándares de observabilidad, monitoreo y alertamiento, trabajando sobre la disponibilidad y performance de los servicios y promoviendo la automatización y mejora continua.

Lo que valoramos de tu perfil

  • Pensamiento sistémico y visión end-to-end.
  • Capacidad analítica para interpretar métricas, logs y trazas e identificar desvíos.
  • Proactividad, autonomía y orientación a la mejora continua.
  • Capacidad para resolver problemas complejos y trabajar sobre incidentes productivos.
  • Orientación a la automatización y eliminación de tareas repetitivas.
  • Buenas habilidades de comunicación y capacidad para trabajar con equipos técnicos y de negocio.
  • Capacidad para influir y promover estándares técnicos en equipos multidisciplinarios.

Tus principales desafíos serán

  • Definir y evolucionar prácticas y estándares de Site Reliability Engineering para servicios críticos.
  • Definir y mantener SLIs, SLOs y Error Budgets, estableciendo métricas objetivas de confiabilidad.
  • Diseñar y mantener estándares de observabilidad, incluyendo logs, métricas, trazas y health checks.
  • Diseñar y optimizar esquemas de alertamiento, definiendo severidades, thresholds, routing, escalamiento y acciones esperadas.
  • Identificar y reducir alertas no accionables y ruido operativo.
  • Construir y mantener dashboards de monitoreo y fuentes de información sobre plataformas centralizadas de observabilidad.
  • Elaborar, probar y mantener runbooks para diagnóstico, mitigación y recuperación de incidentes.
  • Analizar incidentes y oportunidades de mejora, trabajando sobre MTTD, MTTR, disponibilidad y resiliencia.
  • Identificar riesgos de confiabilidad, puntos únicos de falla, problemas recurrentes y oportunidades de automatización.
  • Construir y priorizar un Reliability Engineering Backlog, transformando incidentes y riesgos en iniciativas concretas de mejora.
  • Definir y validar criterios de Reliability Readiness para garantizar que los servicios lleguen a producción con la instrumentación, monitoreo y alertamiento necesarios.
  • Trabajar en conjunto con equipos de Desarrollo, Cloud, Infraestructura, Plataforma, Producto, Operaciones e Incident Management.
  • Participar en procesos de transición e internalización de servicios, asegurando la continuidad de la observabilidad y el monitoreo.

¿Qué esperamos de vos?

  • Experiencia comprobable como Site Reliability Engineer (SRE).
  • Experiencia trabajando sobre sistemas productivos críticos, disponibilidad y confiabilidad de servicios.
  • Sólidos conocimientos de observabilidad, incluyendo logs, métricas, trazas distribuidas y health checks.
  • Experiencia en estándares de instrumentación y telemetría, utilizando OpenTelemetry o tecnologías equivalentes.
  • Experiencia con herramientas de observabilidad como Grafana, Prometheus, Datadog, Dynatrace, Elastic o similares.
  • Experiencia definiendo y trabajando con SLI, SLO, SLA y Error Budget.
  • Experiencia en diseño y gestión de alertas, thresholds, severidades, escalamiento y reducción de alertas no accionables.
  • Experiencia en análisis y resolución de incidentes, incluyendo RCA (Root Cause Analysis) y métricas como MTTD y MTTR.
  • Experiencia trabajando con arquitecturas de microservicios, contenedores y ambientes Cloud.
  • Sólidos conocimientos de AWS.
  • Experiencia trabajando con Kubernetes y Docker.
  • Conocimientos de Linux.
  • Experiencia en scripting y automatización, preferentemente con Python, Bash o similares.
  • Conocimientos de Infrastructure as Code, preferentemente Terraform.
  • Conocimientos de CI/CD y herramientas de integración y deployment.
  • Conocimientos de SQL y capacidad para analizar datos asociados a indicadores de servicio.
  • Formación universitaria o terciaria en Sistemas, Informática, Tecnología o carreras afines será valorada.

¿Qué ofrece el cliente?

  • Relación de dependencia directa con empresa líder en soluciones de pagos.
  • Modalidad híbrida (CABA)
  • 30 días al año de trabajo remoto desde cualquier parte del mundo.
  • Bono anual por performance + revisión salarial periódica.
  • Reintegro mensual de internet y crédito en plataformas de delivery.
  • Prepaga de primer nivel para vos y tu grupo familiar.
  • Días hábiles de vacaciones + licencias extendidas de familia.
  • Acceso a formación continua, certificaciones y convenios educativos.
  • Espacios de trabajo atractivos y tecnológicos.
Facebook
Twitter
LinkedIn
WhatsApp