SRE Pleno

Florianópolis Remote

Estamos com uma posição estratégica em nosso time: SRE Pleno. Você vai atuar em um projeto estruturante de observabilidade, construindo em conjunto com a liderança técnica os processos e a maturidade de SRE do time, além de contribuir diretamente para a confiabilidade dos serviços que sustentam nossa operação em produção, hoje rodando em nuvem (AWS) e on-premises, atendendo múltiplos clientes em diversas regiões do mundo.

Buscamos alguém que atue de forma preventiva: que identifique riscos antes que se tornem incidentes, reduza a recorrência de problemas e transforme cada causa raiz em aprendizado para o time. 

Responsabilidades:

  • Prevenir incidentes em produção, identificando riscos operacionais, pontos de falha e alertas ruidosos antes que se tornem problemas.
  • Participar da construção da plataforma de observabilidade (logs, métricas e tracing), contribuindo na definição de processos, SLIs, SLOs e error budgets.
  • Conduzir análises de causa raiz e liderar postmortems, documentando aprendizados e acompanhando planos de ação até o fechamento.
  • Resolver incidentes críticos, com troubleshooting em ambientes de produção na AWS e on-premises.
  • Identificar oportunidades de FinOps e contribuir para a previsibilidade de custos em nuvem.
  • Colaborar com o time de develop na melhoria contínua da confiabilidade e do desempenho das aplicações.
  • Apoiar demandas de escalabilidade e criação de nova infraestrutura, com foco em automação.
  • Contribuir para a evolução da maturidade de SRE do time (práticas, documentação e cultura de incidentes).
Requirements
  • Experiência sólida com troubleshooting em ambientes produtivos e sistemas distribuídos.
  • Experiência com AWS em produção (EC2, redes, balanceamento de carga, IAM); vivência com ambientes on-premises é um diferencial.
  • Conhecimento em Docker/Docker Compose (containers em produção).
  • Vivência com ferramentas de observabilidade e monitoramento (ex: Grafana, Prometheus, Datadog, SigNoz ou similares) e OpenTelemetry (logs, métricas e tracing).
  • Compreensão de práticas de SRE: SLI/SLO, error budgets, gestão e resolução de incidentes e postmortem.
  • Conhecimentos sólidos em Linux, redes e protocolos (HTTP, TCP/IP, DNS).
  • Boa comunicação, autonomia e resiliência para atuar em momentos críticos de incidentes, incluindo eventual interação direta com o cliente.

Diferenciais:

  • Experiência com automação (Python, Bash, Terraform, Ansible ou similares).
  • Familiaridade com práticas de DevOps: CI/CD e infraestrutura como código (IaC).