Disponível no Kindle Unlimited
Link de afiliado: ao comprar por aqui, o autor recebe uma comissão da Amazon sem custo adicional para você.
Engenharia de Dados com Spark no Databricks
Do zero à produção: PySpark, Spark SQL, Delta Lake, streaming e performance
Do primeiro DataFrame aos pipelines em produção no Databricks, com PySpark, Delta Lake e streaming.
Sobre o livro
Seu código tem poucas linhas. Por que o processamento está levando horas? Fazer um DataFrame funcionar é apenas o começo: o próximo passo é entender como o Spark executa seu código — e como suas decisões afetam desempenho, confiabilidade e custo.
Uma jornada em 56 capítulos, do primeiro DataFrame aos desafios de construir e operar pipelines em escala. A proposta vai além da sintaxe: desenvolver o raciocínio necessário para investigar gargalos e justificar decisões de engenharia. Ao acompanhar a Aurora Commerce, empresa fictícia que conduz o projeto do livro, você relaciona decisões de código aos desafios de uma plataforma de dados — resultados inconsistentes, reprocessamentos, lentidão e custos crescentes.
Você explora PySpark e Spark SQL, trabalha com transformações e joins, compreende partições, shuffle e planos de execução, e estuda otimização com Catalyst, AQE e Photon. Depois avança para Delta Lake, ingestão incremental, CDC, Structured Streaming, Kafka e Lakeflow, conectando o processamento à governança, aos testes, à entrega automatizada e à observabilidade. Laboratórios, desafios e checklists complementam o percurso, junto de referências rápidas, 50 armadilhas e 100 perguntas de entrevista.
O que você vai aprender
- Entenda como o Spark executa seu código — partições, shuffle e planos de execução
- Otimize com Catalyst, AQE e Photon, ligando cada decisão a desempenho e custo
- Construa pipelines com Delta Lake, ingestão incremental, CDC, Structured Streaming e Kafka
- Prepare-se para entrevistas com 50 armadilhas e 100 perguntas do dia a dia da engenharia de dados
Para quem é este livro
- Quem está começando em Spark com uma base de SQL
- Quem já escreve PySpark e quer compreender o que acontece além do notebook
- Engenheiros de dados responsáveis por pipelines em produção