Descrição da vaga

Texto agregado para leitura rápida. Confira sempre a fonte original ao enviar a candidatura.

Principais responsabilidades

  • Definir, implementar e evoluir a estratégia de observabilidade (métricas, logs e tracing distribuído), tendo o AppDynamics como plataforma central de APM, complementada por Prometheus/Grafana, ELK/Splunk e OpenTelemetry.
  • Estabelecer e governar SLIs, SLOs, SLAs e error budgets das aplicações críticas, negociando metas com as áreas de negócio e garantindo o cumprimento.
  • Projetar e manter dashboards operacionais e executivos por persona (negócio, NOC e engenharia), traduzindo telemetria em indicadores acionáveis (MTTR, MTTD, disponibilidade, aderência a SLO, saúde de jornadas de negócio).
  • Implementar detecção de anomalias e indicadores inteligentes (AIOps) — baselines dinâmicos, alertas por desvio, correlação de eventos e redução de ruído.
  • Monitorar e assegurar a saúde da camada de mensageria e integração (RabbitMQ e Kafka): backlog de filas, idade e taxa de consumo de mensagens, DLQ, clustering e resiliência.
  • Comandar incidentes críticos (major incidents): coordenar a resposta, comunicação com stakeholders, escalonamento e restabelecimento do serviço.
  • Conduzir post-mortems / RCA sem culpa, identificando causa raiz e implementando ações preventivas.
  • Reduzir toil por meio de automação operacional, IaC e ferramentas internas.
  • Apoiar capacity planning, testes de resiliência (chaos engineering / game days) e planos de continuidade (BCP/DR — RTO/RPO).
  • Atuar em conformidade com requisitos de segurança, privacidade e regulação (LGPD, PCI-DSS, diretrizes BACEN de resiliência operacional e políticas globais do grupo).

Requisitos

  • Experiência em operação/engenharia de TI.
  • Experiência em SRE ou observabilidade de aplicações de missão crítica.
  • Domínio de AppDynamics (instrumentação, business transactions, health rules, baselines, dashboards e alertas) em ambiente de produção.
  • Experiência sólida com mensageria — RabbitMQ (exchanges, filas, DLQ, clustering) e desejável Kafka.
  • Definição prática de SLI/SLO/SLA e error budgets.
  • Experiência real em gestão de incidentes e regime de on-call.
  • Conhecimento de containers e orquestração (Docker, Kubernetes/OpenShift).
  • Scripting/automação com Python, Go ou Bash.
  • Vivência com CI/CD e Infraestrutura como Código (Terraform, Ansible).
  • Experiência em ambiente de nuvem (AWS, Azure ou GCP).
  • Inglês intermediário/avançado (interação com times globais do cliente).

Vagas relacionadas

Seleção por stack em comum com esta oportunidade

Remoto LinkedIn

IT Analyst III (Java)

F1RST Digital Services • São Paulo • 25 candidaturas Hoje

Salário estimado

R$ 9k - 13k/mês

Pleno CLT

Country: Brazil# QUEM SOMOSA F1RST é o futuro e sua carreira está aqui! Nossa cultura é baseada em “Pessoas, Inovação e Resultados”. Aqui promovemos serviços e experiência para os mais de 60 milhões de clientes de todo o ecossistema Santander. Venha fazer parte do time que tem como propósito apoiar ...

Ver Detalhes →
Remoto LinkedIn

Sr Software Engineer, Frontend (Web)

Uber • São Paulo • 25 candidaturas Hoje

Salário estimado

R$ 15k - 23k/mês

Sênior CLT

About The Role Please note: this hybrid position is based in São Paulo or Rio de Janeiro, Brazil - welcoming both local professionals and those open to relocating. At Uber, Frontend Engineers build web experiences that power the way people move and receive things around the world. As part of our eng...

Ver Detalhes →
LinkedIn Hot

Desenvolvedor de back end

MBRAS • São Paulo • 25 candidaturas Hoje

Salário estimado

R$ 14k - 22k/mês

Sênior CLT

Sobre a EmpresaMBRAS é referência no mercado imobiliário de alto padrão em São Paulo. Estamos construindo internamente as plataformas que sustentam nossa operação — dos sistemas de gestão de portfólio às experiências digitais que conectam clientes aos imóveis mais exclusivos da cidade.Sobre o PapelP...

Ver Detalhes →