Oportunidade: Engenheiro(a) de Dados Databricks - Pleno
Requisitos:
Experiência com Databricks.
Conhecimento de Apache Spark.
Sólidos conhecimentos de SQL.
Conhecimento de Window Functions, incluindo ROW_NUMBER, RANK, DENSE_RANK, LAG, LEAD e LAST_VALUE.
Conhecimento de modelagem e manipulação de dados.
Conhecimento de tipos de dados e conversões.
Experiência com leitura e gravação de arquivos em diferentes formatos.
Conhecimento de processamento distribuído.
Entendimento dos conceitos de Cluster Computing.
Conhecimento dos conceitos de Narrow e Wide Transformations.
Conhecimento sobre Shuffle e seus impactos em performance.
Conhecimento de Projection (Column Pruning).
Conhecimento de Predicate Pushdown.
Experiência com Delta Lake.
Conhecimento sobre versionamento e recuperação de dados (Time Travel).
Experiência com formatos Parquet e Avro.
Atividades
:
Desenvolver pipelines de ingestão, transformação e processamento de dados utilizando Databricks e Spark.
Implementar rotinas de leitura e gravação de dados em diferentes origens e destinos.
Trabalhar com dados estruturados e não estruturados.
Construir consultas SQL para transformação e análise de dados.
Desenvolver e otimizar cargas de dados em ambientes distribuídos.
Aplicar boas práticas de performance em Spark e Databricks.
Trabalhar com Delta Lake para armazenamento e versionamento de dados.
Atuar na solução de problemas relacionados a performance, particionamento e processamento distribuído.
Integrar pipelines de dados com ferramentas de orquestração, como Azure Data Factory.
Colaborar com arquitetos, analistas e demais engenheiros na definição de soluções de dados.
Modelo de atuação
: Híbrido_ St Amaro/SP
Período
: 6 meses