Estamos com uma posição estratégica em nosso time: SRE Pleno. Você vai atuar em um projeto estruturante de observabilidade, construindo em conjunto com a liderança técnica os processos e a maturidade de SRE do time, além de contribuir diretamente para a confiabilidade dos serviços que sustentam nossa operação em produção, hoje rodando em nuvem (AWS) e on-premises, atendendo múltiplos clientes em diversas regiões do mundo.
Buscamos alguém que atue de forma preventiva: que identifique riscos antes que se tornem incidentes, reduza a recorrência de problemas e transforme cada causa raiz em aprendizado para o time.
Responsabilidades:
- Prevenir incidentes em produção, identificando riscos operacionais, pontos de falha e alertas ruidosos antes que se tornem problemas.
- Participar da construção da plataforma de observabilidade (logs, métricas e tracing), contribuindo na definição de processos, SLIs, SLOs e error budgets.
- Conduzir análises de causa raiz e liderar postmortems, documentando aprendizados e acompanhando planos de ação até o fechamento.
- Resolver incidentes críticos, com troubleshooting em ambientes de produção na AWS e on-premises.
- Identificar oportunidades de FinOps e contribuir para a previsibilidade de custos em nuvem.
- Colaborar com o time de develop na melhoria contínua da confiabilidade e do desempenho das aplicações.
- Apoiar demandas de escalabilidade e criação de nova infraestrutura, com foco em automação.
- Contribuir para a evolução da maturidade de SRE do time (práticas, documentação e cultura de incidentes).