Descrição da vaga

Texto agregado para leitura rápida. Confira sempre a fonte original ao enviar a candidatura.

Principais responsabilidades

  • Definir, implementar e evoluir a estratégia de observabilidade (métricas, logs e tracing distribuído), tendo o AppDynamics como plataforma central de APM, complementada por Prometheus/Grafana, ELK/Splunk e OpenTelemetry.
  • Estabelecer e governar SLIs, SLOs, SLAs e error budgets das aplicações críticas, negociando metas com as áreas de negócio e garantindo o cumprimento.
  • Projetar e manter dashboards operacionais e executivos por persona (negócio, NOC e engenharia), traduzindo telemetria em indicadores acionáveis (MTTR, MTTD, disponibilidade, aderência a SLO, saúde de jornadas de negócio).
  • Implementar detecção de anomalias e indicadores inteligentes (AIOps) — baselines dinâmicos, alertas por desvio, correlação de eventos e redução de ruído.
  • Monitorar e assegurar a saúde da camada de mensageria e integração (RabbitMQ e Kafka): backlog de filas, idade e taxa de consumo de mensagens, DLQ, clustering e resiliência.
  • Comandar incidentes críticos (major incidents): coordenar a resposta, comunicação com stakeholders, escalonamento e restabelecimento do serviço.
  • Conduzir post-mortems / RCA sem culpa, identificando causa raiz e implementando ações preventivas.
  • Reduzir toil por meio de automação operacional, IaC e ferramentas internas.
  • Apoiar capacity planning, testes de resiliência (chaos engineering / game days) e planos de continuidade (BCP/DR — RTO/RPO).
  • Atuar em conformidade com requisitos de segurança, privacidade e regulação (LGPD, PCI-DSS, diretrizes BACEN de resiliência operacional e políticas globais do grupo).

Requisitos

  • Experiência em operação/engenharia de TI.
  • Experiência em SRE ou observabilidade de aplicações de missão crítica.
  • Domínio de AppDynamics (instrumentação, business transactions, health rules, baselines, dashboards e alertas) em ambiente de produção.
  • Experiência sólida com mensageria — RabbitMQ (exchanges, filas, DLQ, clustering) e desejável Kafka.
  • Definição prática de SLI/SLO/SLA e error budgets.
  • Experiência real em gestão de incidentes e regime de on-call.
  • Conhecimento de containers e orquestração (Docker, Kubernetes/OpenShift).
  • Scripting/automação com Python, Go ou Bash.
  • Vivência com CI/CD e Infraestrutura como Código (Terraform, Ansible).
  • Experiência em ambiente de nuvem (AWS, Azure ou GCP).
  • Inglês intermediário/avançado (interação com times globais do cliente).

Vagas relacionadas

Seleção por stack em comum com esta oportunidade

Remoto LinkedIn

Desenvolvedor(a) Back End (Júnior/Pleno)

IEBT Innovation Belo Horizonte 85 candidaturas Hoje

Salário estimado

R$ 4k - 7k/mês

Júnior CLT

Buscamos uma pessoa desenvolvedora em início de consolidação de carreira, com experiência prática no desenvolvimento de software e interesse em evoluir continuamente. A pessoa atuará na construção, manutenção e evolução de serviços e aplicações, participando da investigação de problemas, implementaç...

Ver Detalhes
LinkedIn

Senior Software Engineer Python

Thomson Reuters Brasil São Paulo 25 candidaturas Hoje

Salário estimado

R$ 15k - 23k/mês

Sênior CLT

The AI Platform team has been established to build, develop, and run the Enterprise AI Platform. The Enterprise AI Platform serves as a comprehensive ecosystem of collaborative services, tools, and infrastructure, empowering both technical and non-technical users to seamlessly develop, evaluate, dep...

Ver Detalhes
LinkedIn

Analista de desenvolvimento de software Sênior

Serasa Experian Blumenau, Santa Catarina, Brazil 25 candidaturas Hoje

Salário estimado

R$ 11k - 16k/mês

Sênior CLT

Company DescriptionA Experian é uma empresa global de dados e tecnologia que impulsiona oportunidades para pessoas e empresas ao redor do mundo. Atuamos em diversos mercados, como serviços financeiros, saúde, automotivo, agronegócio, seguros, entre outros. A Experian investe em pessoas e em novas te...

Ver Detalhes