Buscamos um(a) Engenheiro(a) de Dados Sênior para integrar um programa de um cliente global do setor automotivo.
A pessoa será corresponsável pela plataforma de dados, trabalhando em parceria com um Analytics Engineer e dividindo as responsabilidades por módulos.
O principal objetivo será construir e operar o pipeline baseado em arquitetura medalhão — desde a ingestão dos dados no Azure, passando pelas camadas Bronze e Silver, até uma camada Gold bem estruturada — garantindo governança, qualidade e disciplina de CI/CD.
A ideia é possibilitar que o Analytics Engineer utilize essa camada Gold para gerar insights, BI e ativos preparados para Data Science, sem precisar corrigir problemas estruturais no pipeline de dados.
Principais responsabilidades
- Arquitetura de pipelines: Projetar e implementar arquitetura medalhão de ponta a ponta no Databricks — ingestão no Azure Data Lake Storage Gen2 e construção das camadas Bronze, Silver e Gold — para fontes batch e quase em tempo real.
- Ingestão de dados: Realizar a ingestão dos dados provenientes dos sistemas-fonte do programa para o Azure, lidando com evolução de schema, validação e reprocessamento em um ambiente com múltiplos sistemas de origem operando simultaneamente.
- Governança: Utilizar o Unity Catalog para garantir controle de acesso, linhagem e governança dos dados em todas as camadas e workspaces.
- Plataforma e CI/CD: Construir e manter pipelines de CI/CD no Azure DevOps e orquestrar os pipelines de produção utilizando Databricks Workflows.
- Modelo de ownership: Dividir a responsabilidade pela plataforma com o Analytics Engineer, deixando claramente documentado quem é responsável pelo quê e em quais prazos.Engenheiro de Dados: ingestão, lógica de transformação e estrutura/qualidade da camada Gold.
- Analytics Engineer: geração de insights, habilitação para Data Science, entrega de BI e documentação construída sobre essa camada.