Senior Data Engineer

PJ, São Paulo Remote

Buscamos um(a) Engenheiro(a) de Dados Sênior para integrar um programa de um cliente global do setor automotivo.

A pessoa será corresponsável pela plataforma de dados, trabalhando em parceria com um Analytics Engineer e dividindo as responsabilidades por módulos.

O principal objetivo será construir e operar o pipeline baseado em arquitetura medalhão — desde a ingestão dos dados no Azure, passando pelas camadas Bronze e Silver, até uma camada Gold bem estruturada — garantindo governança, qualidade e disciplina de CI/CD.

A ideia é possibilitar que o Analytics Engineer utilize essa camada Gold para gerar insights, BI e ativos preparados para Data Science, sem precisar corrigir problemas estruturais no pipeline de dados.

Principais responsabilidades

  • Arquitetura de pipelines: Projetar e implementar arquitetura medalhão de ponta a ponta no Databricks — ingestão no Azure Data Lake Storage Gen2 e construção das camadas Bronze, Silver e Gold — para fontes batch e quase em tempo real.
  • Ingestão de dados: Realizar a ingestão dos dados provenientes dos sistemas-fonte do programa para o Azure, lidando com evolução de schema, validação e reprocessamento em um ambiente com múltiplos sistemas de origem operando simultaneamente.
  • Governança: Utilizar o Unity Catalog para garantir controle de acesso, linhagem e governança dos dados em todas as camadas e workspaces.
  • Plataforma e CI/CD: Construir e manter pipelines de CI/CD no Azure DevOps e orquestrar os pipelines de produção utilizando Databricks Workflows.
  • Modelo de ownership: Dividir a responsabilidade pela plataforma com o Analytics Engineer, deixando claramente documentado quem é responsável pelo quê e em quais prazos.Engenheiro de Dados: ingestão, lógica de transformação e estrutura/qualidade da camada Gold.
  • Analytics Engineer: geração de insights, habilitação para Data Science, entrega de BI e documentação construída sobre essa camada.
Requirements

Requisitos obrigatórios

  • Experiência relevante em Engenharia de Dados, sendo pelo menos 3 anos de experiência prática com Databricks e arquitetura medalhão em produção.
  • Conhecimento de Python, SQL e PySpark.
  • Atuação anterior com Azure Data Lake Storage Gen2, Unity Catalog, Azure DevOps e Databricks Workflows.
  • Inglês fluente obrigatório, pois a posição terá atuação direta com um time de um programa global.

Será considerado um diferencial:

  • Experiência prévia com integração do Salesforce como fonte de dados.
  • Certificação Databricks, como Databricks Certified Data Engineer Professional ou Associate.
  • Experiência no setor automotivo ou em outros programas de manufatura regulados e com múltiplas plantas.

Competências comportamentais:

  • Proatividade: Antecipar problemas e propor melhorias antes de ser solicitado, inclusive em questões identificadas fora do próprio módulo.
  • Comunicação direta: Fazer atualizações proativas sobre status — o que foi concluído, o que vem a seguir e o que está bloqueado —, sinalizar riscos e atrasos antes de ser questionado e registrar por escrito, no mesmo dia, decisões importantes.
  • Ownership: Gerenciar de forma autônoma sua área e ser a principal referência para decisões dentro do seu escopo, sem necessidade de supervisão constante.
  • Cuidado genuíno: Demonstrar preocupação real com o resultado, e não apenas com a execução de uma tarefa. Isso significa levantar uma preocupação que ninguém solicitou, e não simplesmente passar mais horas online.