Visão Geral
O curso Google Cloud Professional Data Engineer (GCP-PDE-201) prepara profissionais para projetar, implementar, operacionalizar, proteger, monitorar e otimizar soluções modernas de engenharia de dados utilizando os serviços do Google Cloud Platform (GCP).
A formação aborda todo o ciclo de vida dos dados, desde a ingestão e processamento de dados em lote e streaming até armazenamento, modelagem, análise, governança, segurança, automação e monitoramento de workloads de dados.
Durante o treinamento, os participantes trabalham com tecnologias e serviços como BigQuery, Cloud Storage, Pub/Sub, Dataflow, Dataproc/Managed Service for Apache Spark, Cloud SQL, Bigtable, Dataplex/Knowledge Catalog, BigQuery ML e Managed Service for Apache Airflow, além de ferramentas de monitoramento, segurança e automação. O ecossistema atual de treinamento do Google Cloud também destaca BigQuery, Dataflow, Data Fusion, Managed Service for Apache Airflow, BigQuery ML e Managed Service for Apache Spark para a formação de Data Engineers.
A formação combina conceitos arquiteturais, boas práticas de engenharia de dados, estudos de caso e laboratórios Hands-On, permitindo ao participante desenvolver soluções de dados escaláveis, confiáveis, seguras e orientadas a requisitos de negócio.
O conteúdo também contempla preparação direcionada para a certificação Google Cloud Professional Data Engineer, cujo exame atual possui duração de 2 horas, 40–50 questões de múltipla escolha e seleção múltipla, sem pré-requisitos formais, embora o Google recomende experiência profissional relevante em cloud e pelo menos um ano projetando e gerenciando soluções no Google Cloud.
Conteúdo Programatico
Module 1: Fundamentos de Data Engineering no Google Cloud
1.1 Data Engineering e arquitetura moderna de dados
1.2 Características de workloads analíticos e operacionais
1.3 Data Lake, Data Warehouse e Lakehouse
1.4 Arquiteturas batch, streaming e híbridas
1.5 ETL, ELT e ELT moderno
1.6 Data-driven architecture
1.7 Seleção de serviços Google Cloud para workloads de dados
1.8 Google Cloud Console, Cloud Shell e Google Cloud CLI
1.9 Organização, projetos, regiões e zonas
1.10 Hands-On: configuração do ambiente de Data Engineering
Module 2: Data Storage e Data Management
2.1 Cloud Storage para data lakes
2.2 Classes de armazenamento e lifecycle management
2.3 BigQuery como plataforma analítica
2.4 Cloud SQL
2.5 Cloud Spanner
2.6 Bigtable
2.7 Firestore
2.8 Escolha do armazenamento adequado ao workload
2.9 Structured, semi-structured e unstructured data
2.10 OLTP versus OLAP
2.11 Estratégias de retenção e ciclo de vida
2.12 Hands-On: implementação de uma arquitetura de armazenamento
Module 3: BigQuery Data Warehouse
3.1 Arquitetura do BigQuery
3.2 Datasets e tabelas
3.3 Schemas e tipos de dados
3.4 SQL no BigQuery
3.5 Views e materialized views
3.6 External tables
3.7 Particionamento
3.8 Clustering
3.9 Joins e agregações
3.10 Performance de consultas
3.11 Controle de custos
3.12 BigQuery Storage e Compute
3.13 BigQuery BI Engine
3.14 Hands-On: construção de um Data Warehouse no BigQuery
Module 4: Data Ingestion e Data Integration
4.1 Estratégias de ingestão de dados
4.2 Batch ingestion
4.3 Streaming ingestion
4.4 Pub/Sub
4.5 Conectividade entre fontes e destinos
4.6 Data Fusion
4.7 Transferência de dados para o Google Cloud
4.8 APIs e fontes externas
4.9 CDC — Change Data Capture
4.10 Tratamento de dados duplicados
4.11 Idempotência
4.12 Hands-On: implementação de pipeline de ingestão
Module 5: Data Processing com Dataflow e Apache Beam
5.1 Introdução ao Dataflow
5.2 Apache Beam
5.3 Batch pipelines
5.4 Streaming pipelines
5.5 PCollections
5.6 Transforms
5.7 ParDo e funções de processamento
5.8 Windowing
5.9 Triggers
5.10 Watermarks
5.11 Event time e processing time
5.12 Tratamento de dados atrasados
5.13 Escalabilidade e autoscaling
5.14 Monitoring de pipelines Dataflow
5.15 Hands-On: construção de pipeline batch
5.16 Hands-On: construção de pipeline streaming
Module 6: Big Data Processing com Apache Spark
6.1 Conceitos de processamento distribuído
6.2 Apache Spark
6.3 Managed Service for Apache Spark
6.4 Spark DataFrames
6.5 Spark SQL
6.6 Processamento distribuído
6.7 Data transformation
6.8 Performance e particionamento
6.9 Integração com Cloud Storage e BigQuery
6.10 Migração de workloads Hadoop/Spark
6.11 Hands-On: processamento distribuído de datasets
Module 7: Data Modeling e Data Analytics
7.1 Princípios de modelagem de dados analíticos
7.2 Dimensional modeling
7.3 Star schema
7.4 Snowflake schema
7.5 Normalização e desnormalização
7.6 Data marts
7.7 Dados históricos
7.8 Data quality
7.9 Data cleansing
7.10 Data enrichment
7.11 Preparação de dados para Analytics
7.12 Preparação de dados para Machine Learning
Module 8: Data Governance, Security e Compliance
8.1 Data governance
8.2 IAM aplicado a dados
8.3 Roles e permissions
8.4 Service Accounts
8.5 Princípio do menor privilégio
8.6 Criptografia de dados
8.7 Customer-managed encryption keys
8.8 Secret management
8.9 Controle de acesso a datasets
8.10 Proteção de dados sensíveis
8.11 PII e dados regulamentados
8.12 Data classification
8.13 Data lineage
8.14 Data discovery
8.15 Dataplex/Knowledge Catalog
8.16 Auditoria e Cloud Audit Logs
Module 9: Machine Learning e BigQuery ML
9.1 Machine Learning aplicado à engenharia de dados
9.2 Preparação de datasets para ML
9.3 BigQuery ML
9.4 Criação de modelos utilizando SQL
9.5 Feature engineering
9.6 Treinamento e avaliação de modelos
9.7 Predições
9.8 Integração entre BigQuery e Machine Learning
9.9 Pipelines de dados para ML
9.10 Considerações de segurança e governança em workloads de ML
9.11 Hands-On: criação de modelo utilizando BigQuery ML
Module 10: Data Operations, Monitoring e Reliability
10.1 Data workload operations
10.2 Cloud Monitoring
10.3 Cloud Logging
10.4 Métricas e alertas
10.5 Monitoramento de pipelines
10.6 Data quality monitoring
10.7 Troubleshooting
10.8 Falhas e recuperação de pipelines
10.9 Retry e error handling
10.10 Alta disponibilidade
10.11 Resiliência e fault tolerance
10.12 Disaster recovery para plataformas de dados
10.13 Hands-On: monitoramento e troubleshooting de pipeline
Module 11: Automação e Orquestração de Data Workloads
11.1 Automação de workloads
11.2 Managed Service for Apache Airflow
11.3 DAGs e workflows
11.4 Agendamento de pipelines
11.5 Dependências entre tarefas
11.6 Data pipeline orchestration
11.7 Integração entre Airflow, BigQuery, Cloud Storage e Dataflow
11.8 Automação utilizando APIs e CLI
11.9 Infrastructure as Code para ambientes de dados
11.10 Hands-On: criação e execução de workflow de dados
Module 12: Performance, Scalability e Cost Optimization
12.1 Dimensionamento de workloads
12.2 Escalabilidade horizontal e vertical
12.3 Otimização de BigQuery
12.4 Particionamento e clustering
12.5 Otimização de Dataflow
12.6 Otimização de Spark
12.7 Gerenciamento de armazenamento
12.8 Controle de consumo de recursos
12.9 Cost optimization
12.10 Monitoring de custos
12.11 Capacity planning
12.12 Trade-offs entre performance, custo e confiabilidade
Module 13: Arquiteturas de Data Engineering
13.1 Arquitetura de Data Lake
13.2 Arquitetura de Data Warehouse
13.3 Arquitetura Lakehouse
13.4 Batch Data Processing Architecture
13.5 Streaming Data Architecture
13.6 Lambda Architecture
13.7 Event-driven data architecture
13.8 Modern Data Platform
13.9 Data Mesh e governança distribuída
13.10 Arquiteturas híbridas
13.11 Integração com ambientes on-premises
13.12 Estudos de caso empresariais
13.13 Hands-On: desenho de arquitetura completa de Data Engineering
Module 14: Preparação para a Certificação Professional Data Engineer
14.1 Estrutura e características do exame
14.2 Revisão dos domínios da certificação
14.3 Design de sistemas de processamento de dados
14.4 Ingestão e processamento de dados
14.5 Armazenamento de dados
14.6 Preparação e utilização de dados para análise
14.7 Manutenção e automação de workloads
14.8 Estudos de caso
14.9 Cenários de arquitetura e tomada de decisão
14.10 Questões práticas e análise das respostas
14.11 Estratégias para resolução de questões
14.12 Simulado final
14.13 Revisão dos principais pontos técnicos