Data Engineer Specialist

São Paulo Remote

Estamos buscando um(a) Data Engineer Specialist para escalar com a gente.

Somos uma sales tech que coloca tecnologia, dados e inteligência artificial no centro das jornadas de vendas. Aqui, pessoas, inovação e alta performance caminham juntas para levar grandes marcas ao futuro da aquisição digital.

Buscamos alguém que curta desafios, tecnologia e aprendizado contínuo, e queira fazer parte dos Escalers, apaixonados por construir soluções que geram impacto. Aqui, quem escala com a gente evolui junto. 

#FaçaParteDaEscalada: vem saber o que esperamos de você 

A equipe busca um profissional orientado a desafios para integrar um ambiente colaborativo e transformar fontes de dados diversas em decisões estratégicas. 

Resposabilidades: 

  • Construir, manter e evoluir os pipelines da esteira S3 → Databricks/Airflow → dbt, escalando para o crescimento de volume da Escale;
  • Monitorar a esteira em produção, identificar falha, atraso ou dado fora do padrão antes que o problema chegue no consumo, e ser quem corrige e ajusta o fluxo quando algo quebra;
  • Metrificar e monitorar sistemas com foco em custo operacional, data quality e consistência dos dados;
  • Gerenciar infraestrutura como código (Terraform) e deploy da plataforma de dados via Kubernetes (EKS) e Argo;
  • Garantir governança do dado via OpenMetadata: disponibilidade, escalabilidade e controle de acesso do que está no lake e no warehouse;
  • Tratar dado sensível com segurança, identificar PII e aplicar mascaramento/anonimização antes desse dado circular para consumo analítico ou produto;
  • Definir e evoluir ferramentas de self-service (ELT / ETL) para reduzir dependência do time de dados em demandas simples;
  • Estruturar e entregar dado pronto para uso em IA (modelos preditivos, LLMs), incluindo preparação para RAG/embeddings quando aplicável;
  • Avaliar novas tecnologias para a stack e manter o que já está em produção funcionando bem, incluindo alternativas open-source;
  • Suportar áreas internas que consomem a plataforma, resolvendo dúvida técnica e disseminando boa prática de uso do dado.
     
Requirements

Obrigatórios

  • Experiência com engenharia de software (Python, Java ou Scala) e boas práticas (ex.: Clean Architecture, TDD);
  • Arquitetura de dados Lambda e modelagem analítica;
  • AWS, com ingestão hoje centrada em S3;
  • Databricks para processamento distribuído;
  • Orquestração de pipeline com Airflow;
  • Containers e Kubernetes Docker, Kubernetes, stateless e stateful);
  • Infraestrutura como código com Terraform;
  • Deploy/GitOps com ArgoCD (implantação declarativa via Kubernetes/EKS)
  • Modelagem e transformação analítica com dbt;
  • Governança de dados com OpenMetadata (disponibilidade, escalabilidade, linhagem, controle de acesso);
  • Familiaridade com integração de pipelines com APIs de modelos de linguagem (ex.: OpenAI, Cohere, Hugging Face);
  • Segurança e tratamento de dado sensível: identificação de PII, mascaramento, anonimização;
  • Vivência de DataOps, monitoramento, alerta e correção de falha em pipeline em produção, não só construção.

 

Desejáveis

  • Arquitetura Kappa como diferencial complementar à Lambda;
  • Conhecimento em soluções open-source alternativas para ingestão, processamento e disponibilização de dados;
  • Compreensão de boas práticas de segurança e governança de dados (framework DAMA) como referência conceitual;
  • Familiaridade com integração de pipelines a APIs de modelos de linguagem (OpenAI, Cohere, Hugging Face);
  • Interesse ou familiaridade com fundamentos de LLMs e IA generativa aplicada a dados;
  • Experiência com processamento de dados em streaming (Kafka, Flink, Druid).