Engenheiro(a) SRE Sênior – Observabilidade & Confiabilidade | Groovetech

PJ, 21419 Remote


Buscamos um(a) Engenheiro(a) SRE Sênior com perfil mão na massa, alta autonomia e forte senso de dono para integrar um projeto estratégico da GrooveTech alocado em um grande player do setor de meios de pagamento, serviços financeiros e fintechs, com duração inicial de 4 meses.

O desafio exige um profissional que atue como a referência técnica e real "dono" da observabilidade e confiabilidade da plataforma. Procuramos alguém altamente operacional, capaz de se conectar rapidamente com o negócio, automatizar rotinas e elevar a maturidade operacional do ecossistema sem necessidade de microgerenciamento.

Liderar a administração e evolução do Datadog como plataforma central de observabilidade (APM, traces, pipelines de logs, métricas, RUM, Synthetics, SLOs, monitores e Cloud SIEM);
Garantir cobertura total de observabilidade para ambientes produtivos na AWS (ECS, Lambda, API Gateway, DynamoDB, EventBridge/SQS, CloudFront e WAF);
Definir e acompanhar SLIs e SLOs para jornadas críticas (autorização, onboarding, portais), monitorando o consumo de error budget;
Desenhar alertas focados em sinal (não em volume): eliminar falsos positivos, re-notificações e monitores ineficientes;
Integrar e auditar logs de segurança (CloudTrail, GuardDuty, Inspector, Macie, VPC Flow Logs);
Conduzir a resposta a incidentes críticos: triagem, correlação de eventos, comunicação transparente e liderança de análises de causa raiz (RCA) e postmortems;
Manter a governança técnica: elaboração de runbooks, playbooks e apoio a processos de Gestão de Mudanças (Jira Service Management);
Apoiar a conformidade PCI DSS: produção de evidências de monitoramento, logging, FIM e suporte a auditorias e testes de penetração;
Gestão de FinOps em Observabilidade: otimizar custos com retenção, indexação de logs e cardinalidade de métricas no Datadog.

Requirements

Trajetória sólida e prática (+8 anos) em SRE, Observabilidade ou Sustentação de Ambientes Críticos;
Domínio profundo e avançado da plataforma Datadog (APM, Traces, Logs, Synthetics, SLOs e Dashboards);
Forte conhecimento em arquitetura AWS voltado a troubleshooting operacional (CloudWatch, CloudTrail, ECS, Lambda, filas e eventos);
Prática em gestão de incidentes, problemas e mudanças (ITIL ou equivalente);
Histórico em elaboração de documentação técnica estruturada (runbooks, playbooks e postmortems).

Comportamentais:

Perfil Operacional & Mão na Massa (Mandatório): Capacidade de executar, corrigir e entregar com agilidade, sem se limitar ao nível teórico/arquitetural;
Sentimento de Dono & Autonomia: Capacidade de gerenciar a disciplina de observabilidade e priorizar backlogs com independência, sem necessidade de microgerenciamento;
Alta Resiliência e Agilidade: Excelente capacidade de adaptação a rotinas dinâmicas, com receptividade a feedbacks e foco na melhoria contínua;
Comunicação Colaborativa: Excelente relacionamento interpessoal para trabalhar de forma alinhada e transparente com os times de engenharia, QA e produto.
Inglês Avançado a Fluente

Diferenciais Importantes:
Experiência em ambientes de meios de pagamento, fintechs ou regulados por PCI DSS;
Conhecimentos em Cloud SIEM e ferramentas de segurança AWS (GuardDuty, Inspector, Macie);
Práticas de Observabilidade como Código (Terraform / API Datadog);
Leitura e análise de código em Go e/ou TypeScript/Node.js para apoio em diagnósticos.

Benefits

Modelo de contratação: PJ (160h mensais - Projeto com duração inicial de 4 meses);
Formato: Remoto 
Suporte Contínuo GrooveTech: Acompanhamento pelo nosso Back Office técnico e de gestão para garantir onboarding acelerado e suporte na sua jornada;
Benefícios extra: Seguro de Vida + Acesso ao ecossistema Wellhub (antigo Gympass).