Databricks certified data engineer associate

  • DevOps | CI | CD | Kubernetes | Web3

Databricks certified data engineer associate

90 minutos
Visão Geral

O exame de certificação Databricks Certified Data Engineer Associate avalia a capacidade do profissional de utilizar a Plataforma de Inteligência de Dados Databricks para executar tarefas fundamentais de engenharia de dados. O exame avalia o conhecimento do candidato sobre a Plataforma de Inteligência de Dados, seu espaço de trabalho, arquitetura e recursos, as tarefas relacionadas à ingestão, carregamento, transformação e modelagem de dados — como a capacidade de realizar tarefas de Extração, Transformação e Carga (ETL) usando PySpark, trabalhar com Jobs do Lakeflow e CI/CD. Por fim, o exame avalia a compreensão do candidato sobre técnicas de solução de problemas, monitoramento e otimização, bem como seu conhecimento sobre como alcançar Governança e Segurança na Plataforma Databricks.

O exame abrange:

  1. Plataforma de Inteligência Databricks - 6%
  2. Ingestão e carregamento de dados - 21%
  3. Transformação e modelagem de dados - 22%
  4. Trabalhar com a Lakeflow Jobs - 16%
  5. Implementação de CI/CD - 10%
  6. Solução de problemas, monitoramento e otimização - 10%
  7. Governança e Segurança - 15%
Materiais
Inglês
Conteúdo Programatico
  • Tipo: Certificação supervisionada
  • Número total de questões pontuadas: 45
  • Tempo limite: 90 minutos
  • Taxa de inscrição: US$ 200
  • Tipos de questões: Múltipla escolha
  • Auxiliares de teste: Nenhum permitido
  • Idiomas: Inglês, Português BR 
  • Método de entrega: Online
  • Pré-requisitos: Nenhum, mas treinamento relacionado é altamente recomendado.
  • Experiência recomendada: experiência prática na execução das tarefas de engenharia de dados descritas no guia do exame.
  • Período de validade: 2 anos
  • Recertificação: A recertificação é necessária a cada dois anos para manter seu status de certificado. Para se recertificar, você deve fazer a versão atual do exame. Consulte a seção "Preparando-se para o Exame" abaixo para se preparar para o exame de recertificação.
  • Conteúdo não pontuado: As provas podem incluir itens não pontuados para coletar informações estatísticas para uso futuro. Esses itens não são identificados no formulário e não afetam sua nota. O tempo das provas é ampliado para compensar esse conteúdo.

Seção 1: Plataforma de Inteligência de Dados Databricks (6%)

  • Compreender os principais componentes da Plataforma de Inteligência de Dados da Databricks, como sua arquitetura, o Delta Lake e o Unity Catalog.
  • Compreender os serviços de computação (compute) da Plataforma de Inteligência de Dados da Databricks, incluindo suas características, limitações e modelos de custo, selecionando a opção mais adequada para cada caso de uso e carga de trabalho.

Seção 2: Ingestão e Carregamento de Dados (21%)

  • Compreender e detalhar os padrões de ingestão de dados, incluindo carregamento em lote (batch), streaming e incremental, além de importar dados de diversas fontes, como arquivos locais, conectores padrão do Lakeflow Connect e conectores gerenciados do Lakeflow Connect.
  • Utilizar o comando COPY INTO para carregar incrementalmente arquivos armazenados em serviços de armazenamento de objetos em nuvem (ADLS, S3 e GCS) em tabelas governadas pelo Unity Catalog.
  • Utilizar o Auto Loader com aplicação e evolução de esquemas (schema enforcement e schema evolution) em modo batch (por exemplo, listagem de diretórios ou notificações de arquivos) para carregar dados em tabelas governadas pelo Unity Catalog.
  • Configurar o Lakeflow Connect para realizar a ingestão confiável de dados provenientes de diversas fontes corporativas em tabelas governadas pelo Unity Catalog.
  • Utilizar clientes JDBC, ODBC ou REST em notebooks para carregar dados em serviços de armazenamento em nuvem ou diretamente em tabelas governadas pelo Unity Catalog, normalmente orquestrados e agendados utilizando o Lakeflow Jobs.
  • Selecionar a melhor opção entre Auto Loader, Lakeflow Connect (conectores padrão e gerenciados), conectores de parceiros e outros métodos de ingestão, considerando requisitos técnicos como volume de dados, frequência de ingestão, tipos de dados e necessidades de governança com o Unity Catalog.
  • Realizar a ingestão de dados semiestruturados e não estruturados (por exemplo, JSON e dados aninhados) por meio do Lakeflow Connect e outros conectores gerenciados para tabelas Delta governadas pelo Unity Catalog.

Seção 3: Transformação e Modelagem de Dados (22%)

  • Implementar processos de limpeza de dados utilizando PySpark ou SQL para leitura de tabelas Bronze, tratando valores nulos, padronizando tipos de dados e gravando os resultados em novas tabelas Silver.
  • Combinar DataFrames utilizando operações como:
    • Inner Join;
    • Left Join;
    • Broadcast Join;
    • Múltiplos Joins;
    • Outras técnicas de combinação e transformação de dados aplicáveis ao ambiente Databricks.
    • Seção 3: Transformação e Modelagem de Dados (22%) – Continuação

Combinar DataFrames utilizando operações como:

  • Junção por chaves (Keys);
  • Cross Join;
  • Union;
  • Union All;
  • Inner Join;
  • Left Join;
  • Broadcast Join;
  • Múltiplos Joins.

Manipular colunas, linhas e estruturas de tabelas, incluindo:

  • Adicionar colunas;
  • Remover colunas;
  • Dividir colunas;
  • Renomear colunas;
  • Aplicar filtros;
  • Explodir arrays (expandir elementos de listas e coleções em múltiplas linhas).

Realizar operações de remoção de registros duplicados (deduplicação) e agregações em DataFrames, tais como:

  • Count (contagem de registros);
  • Approximate Count Distinct (contagem aproximada de valores distintos);
  • Mean (média);
  • Summary (estatísticas resumidas dos dados).

Compreender os principais parâmetros de ajuste de desempenho do Apache Spark e realizar medições de performance após as configurações, incluindo:

  • spark.sql.shuffle.partitions;
  • spark.default.parallelism;
  • spark.executor.memory;
  • spark.driver.memory;
  • spark.sql.autoBroadcastJoinThreshold.

Compreender as diferenças entre os objetos da camada Gold no Unity Catalog e saber como construí-los, incluindo:

  • Materialized Views (visões materializadas);
  • Views (visões);
  • Streaming Tables (tabelas de streaming);
  • Tabelas destinadas às equipes de Business Intelligence (BI) e Analytics.

Aplicar verificações de qualidade dos dados (Data Quality Checks) e regras de validação para garantir a confiabilidade dos conjuntos de dados das camadas Silver e Gold.


Seção 4: Trabalhando com Lakeflow Jobs (16%)

  • Implementar fluxos de controle (Control Flows), incluindo:
    • Tentativas automáticas de reexecução (Retries);
    • Tarefas condicionais, como ramificações (Branching) e laços de repetição (Looping), utilizando o Lakeflow Jobs para orquestração de pipelines.
  • Configurar tarefas comuns e suas dependências utilizando o Lakeflow Jobs e seu grafo de tarefas baseado em DAG (Directed Acyclic Graph), incluindo:
    • Execução de Notebooks;
    • Consultas SQL;
    • Dashboards;
    • Pipelines de dados.
  • Implementar agendamentos de execução (Schedules) utilizando o Lakeflow Jobs, compreendendo os diferentes tipos de gatilhos (Triggers), como:
    • Execução agendada por horário (Scheduled);
    • Chegada de arquivos (File Arrival);
    • Atualização de tabelas (Table Update).
  • Selecionar entre gatilhos baseados em tempo (Time-Based Triggers) e gatilhos orientados por eventos ou disponibilidade dos dados (Data-Driven Triggers), considerando:
    • Disponibilidade dos dados;
    • Dependências entre pipelines;
    • Requisitos de processamento dos workloads.
    • Identify common performance bottlenecks such as data skew, shuffling, and disk spilling by interpreting stage-level metrics in the Spark UI. ● Understand the features of Liquid Clustering and predictive optimization. ● Diagnose cluster startup failures, library conflicts, and out-of-memory issues. Section 7: Governance and Security (15%) ● Differentiate between managed and external tables in Unity Catalog and perform basic operations (create, modify, delete, and convert between managed and external tables) on them. ● Configure access controls using the UI and SQL by applying GRANT, REVOKE, and DENY privileges to principals (users, groups, and service principals) at appropriate levels of the security hierarchy. ● Understand column-level masking and row-level security to restrict data visibility based on user groups. ● Understand Unity Catalog ABAC policies to centrally control row-level filtering and column masking for sensitive data.
TENHO INTERESSE

Cursos Relacionados

Curso Terraform Deploying to Oracle Cloud Infrastructure

24 Horas

Ansible Overview of Ansible architecture

16h

Curso FOCUS FinOps Introduction

8 horas

FOCUS (FinOps Open Cost and Usage Specification) Deep Dive

24 horas

Curso Microsoft MD-102T00 Microsoft 365 Endpoint Administrator

32 horas Curso Pratico

Curso Standardizing Cloud Billing Data using FOCUS

24 horas