Visão Geral
O exame de certificação Databricks Certified Data Engineer Associate avalia a capacidade do profissional de utilizar a Plataforma de Inteligência de Dados Databricks para executar tarefas fundamentais de engenharia de dados. O exame avalia o conhecimento do candidato sobre a Plataforma de Inteligência de Dados, seu espaço de trabalho, arquitetura e recursos, as tarefas relacionadas à ingestão, carregamento, transformação e modelagem de dados — como a capacidade de realizar tarefas de Extração, Transformação e Carga (ETL) usando PySpark, trabalhar com Jobs do Lakeflow e CI/CD. Por fim, o exame avalia a compreensão do candidato sobre técnicas de solução de problemas, monitoramento e otimização, bem como seu conhecimento sobre como alcançar Governança e Segurança na Plataforma Databricks.
O exame abrange:
- Plataforma de Inteligência Databricks - 6%
- Ingestão e carregamento de dados - 21%
- Transformação e modelagem de dados - 22%
- Trabalhar com a Lakeflow Jobs - 16%
- Implementação de CI/CD - 10%
- Solução de problemas, monitoramento e otimização - 10%
- Governança e Segurança - 15%
Conteúdo Programatico
- Tipo: Certificação supervisionada
- Número total de questões pontuadas: 45
- Tempo limite: 90 minutos
- Taxa de inscrição: US$ 200
- Tipos de questões: Múltipla escolha
- Auxiliares de teste: Nenhum permitido
- Idiomas: Inglês, Português BR
- Método de entrega: Online
- Pré-requisitos: Nenhum, mas treinamento relacionado é altamente recomendado.
- Experiência recomendada: experiência prática na execução das tarefas de engenharia de dados descritas no guia do exame.
- Período de validade: 2 anos
- Recertificação: A recertificação é necessária a cada dois anos para manter seu status de certificado. Para se recertificar, você deve fazer a versão atual do exame. Consulte a seção "Preparando-se para o Exame" abaixo para se preparar para o exame de recertificação.
- Conteúdo não pontuado: As provas podem incluir itens não pontuados para coletar informações estatísticas para uso futuro. Esses itens não são identificados no formulário e não afetam sua nota. O tempo das provas é ampliado para compensar esse conteúdo.
Seção 1: Plataforma de Inteligência de Dados Databricks (6%)
- Compreender os principais componentes da Plataforma de Inteligência de Dados da Databricks, como sua arquitetura, o Delta Lake e o Unity Catalog.
- Compreender os serviços de computação (compute) da Plataforma de Inteligência de Dados da Databricks, incluindo suas características, limitações e modelos de custo, selecionando a opção mais adequada para cada caso de uso e carga de trabalho.
Seção 2: Ingestão e Carregamento de Dados (21%)
- Compreender e detalhar os padrões de ingestão de dados, incluindo carregamento em lote (batch), streaming e incremental, além de importar dados de diversas fontes, como arquivos locais, conectores padrão do Lakeflow Connect e conectores gerenciados do Lakeflow Connect.
- Utilizar o comando
COPY INTO para carregar incrementalmente arquivos armazenados em serviços de armazenamento de objetos em nuvem (ADLS, S3 e GCS) em tabelas governadas pelo Unity Catalog.
- Utilizar o Auto Loader com aplicação e evolução de esquemas (schema enforcement e schema evolution) em modo batch (por exemplo, listagem de diretórios ou notificações de arquivos) para carregar dados em tabelas governadas pelo Unity Catalog.
- Configurar o Lakeflow Connect para realizar a ingestão confiável de dados provenientes de diversas fontes corporativas em tabelas governadas pelo Unity Catalog.
- Utilizar clientes JDBC, ODBC ou REST em notebooks para carregar dados em serviços de armazenamento em nuvem ou diretamente em tabelas governadas pelo Unity Catalog, normalmente orquestrados e agendados utilizando o Lakeflow Jobs.
- Selecionar a melhor opção entre Auto Loader, Lakeflow Connect (conectores padrão e gerenciados), conectores de parceiros e outros métodos de ingestão, considerando requisitos técnicos como volume de dados, frequência de ingestão, tipos de dados e necessidades de governança com o Unity Catalog.
- Realizar a ingestão de dados semiestruturados e não estruturados (por exemplo, JSON e dados aninhados) por meio do Lakeflow Connect e outros conectores gerenciados para tabelas Delta governadas pelo Unity Catalog.
Seção 3: Transformação e Modelagem de Dados (22%)
- Implementar processos de limpeza de dados utilizando PySpark ou SQL para leitura de tabelas Bronze, tratando valores nulos, padronizando tipos de dados e gravando os resultados em novas tabelas Silver.
- Combinar DataFrames utilizando operações como:
- Inner Join;
- Left Join;
- Broadcast Join;
- Múltiplos Joins;
- Outras técnicas de combinação e transformação de dados aplicáveis ao ambiente Databricks.
-
Seção 3: Transformação e Modelagem de Dados (22%) – Continuação
Combinar DataFrames utilizando operações como:
- Junção por chaves (Keys);
- Cross Join;
- Union;
- Union All;
- Inner Join;
- Left Join;
- Broadcast Join;
- Múltiplos Joins.
Manipular colunas, linhas e estruturas de tabelas, incluindo:
- Adicionar colunas;
- Remover colunas;
- Dividir colunas;
- Renomear colunas;
- Aplicar filtros;
- Explodir arrays (expandir elementos de listas e coleções em múltiplas linhas).
Realizar operações de remoção de registros duplicados (deduplicação) e agregações em DataFrames, tais como:
- Count (contagem de registros);
- Approximate Count Distinct (contagem aproximada de valores distintos);
- Mean (média);
- Summary (estatísticas resumidas dos dados).
Compreender os principais parâmetros de ajuste de desempenho do Apache Spark e realizar medições de performance após as configurações, incluindo:
spark.sql.shuffle.partitions;
spark.default.parallelism;
spark.executor.memory;
spark.driver.memory;
spark.sql.autoBroadcastJoinThreshold.
Compreender as diferenças entre os objetos da camada Gold no Unity Catalog e saber como construí-los, incluindo:
- Materialized Views (visões materializadas);
- Views (visões);
- Streaming Tables (tabelas de streaming);
- Tabelas destinadas às equipes de Business Intelligence (BI) e Analytics.
Aplicar verificações de qualidade dos dados (Data Quality Checks) e regras de validação para garantir a confiabilidade dos conjuntos de dados das camadas Silver e Gold.
Seção 4: Trabalhando com Lakeflow Jobs (16%)
- Implementar fluxos de controle (Control Flows), incluindo:
- Tentativas automáticas de reexecução (Retries);
- Tarefas condicionais, como ramificações (Branching) e laços de repetição (Looping), utilizando o Lakeflow Jobs para orquestração de pipelines.
- Configurar tarefas comuns e suas dependências utilizando o Lakeflow Jobs e seu grafo de tarefas baseado em DAG (Directed Acyclic Graph), incluindo:
- Execução de Notebooks;
- Consultas SQL;
- Dashboards;
- Pipelines de dados.
- Implementar agendamentos de execução (Schedules) utilizando o Lakeflow Jobs, compreendendo os diferentes tipos de gatilhos (Triggers), como:
- Execução agendada por horário (Scheduled);
- Chegada de arquivos (File Arrival);
- Atualização de tabelas (Table Update).
- Selecionar entre gatilhos baseados em tempo (Time-Based Triggers) e gatilhos orientados por eventos ou disponibilidade dos dados (Data-Driven Triggers), considerando:
- Disponibilidade dos dados;
- Dependências entre pipelines;
- Requisitos de processamento dos workloads.
- Identify common performance bottlenecks such as data skew, shuffling, and disk spilling by interpreting stage-level metrics in the Spark UI. ● Understand the features of Liquid Clustering and predictive optimization. ● Diagnose cluster startup failures, library conflicts, and out-of-memory issues. Section 7: Governance and Security (15%) ● Differentiate between managed and external tables in Unity Catalog and perform basic operations (create, modify, delete, and convert between managed and external tables) on them. ● Configure access controls using the UI and SQL by applying GRANT, REVOKE, and DENY privileges to principals (users, groups, and service principals) at appropriate levels of the security hierarchy. ● Understand column-level masking and row-level security to restrict data visibility based on user groups. ● Understand Unity Catalog ABAC policies to centrally control row-level filtering and column masking for sensitive data.