Pular para o conteúdo
Capa do livro Engenharia de Dados com Spark no Databricks, de Eduardo Vieira

Disponível no Kindle Unlimited

Comprar na Amazon

Link de afiliado: ao comprar por aqui, o autor recebe uma comissão da Amazon sem custo adicional para você.

Engenharia de Dados com Spark no Databricks

Do zero à produção: PySpark, Spark SQL, Delta Lake, streaming e performance

por Eduardo Vieira

Do primeiro DataFrame aos pipelines em produção no Databricks, com PySpark, Delta Lake e streaming.

Ano
2026
Páginas
1139
Idioma
pt-BR
Formatos
Kindle
ASIN
B0HJP8S9X7

Sobre o livro

Seu código tem poucas linhas. Por que o processamento está levando horas? Fazer um DataFrame funcionar é apenas o começo: o próximo passo é entender como o Spark executa seu código — e como suas decisões afetam desempenho, confiabilidade e custo.

Uma jornada em 56 capítulos, do primeiro DataFrame aos desafios de construir e operar pipelines em escala. A proposta vai além da sintaxe: desenvolver o raciocínio necessário para investigar gargalos e justificar decisões de engenharia. Ao acompanhar a Aurora Commerce, empresa fictícia que conduz o projeto do livro, você relaciona decisões de código aos desafios de uma plataforma de dados — resultados inconsistentes, reprocessamentos, lentidão e custos crescentes.

Você explora PySpark e Spark SQL, trabalha com transformações e joins, compreende partições, shuffle e planos de execução, e estuda otimização com Catalyst, AQE e Photon. Depois avança para Delta Lake, ingestão incremental, CDC, Structured Streaming, Kafka e Lakeflow, conectando o processamento à governança, aos testes, à entrega automatizada e à observabilidade. Laboratórios, desafios e checklists complementam o percurso, junto de referências rápidas, 50 armadilhas e 100 perguntas de entrevista.

O que você vai aprender

  • Entenda como o Spark executa seu código — partições, shuffle e planos de execução
  • Otimize com Catalyst, AQE e Photon, ligando cada decisão a desempenho e custo
  • Construa pipelines com Delta Lake, ingestão incremental, CDC, Structured Streaming e Kafka
  • Prepare-se para entrevistas com 50 armadilhas e 100 perguntas do dia a dia da engenharia de dados

Para quem é este livro

  • Quem está começando em Spark com uma base de SQL
  • Quem já escreve PySpark e quer compreender o que acontece além do notebook
  • Engenheiros de dados responsáveis por pipelines em produção

Temas abordados

  • engenharia de dados
  • spark
  • pyspark
  • databricks
  • delta lake
  • structured streaming
  • pipelines de dados
  • otimização de performance

Amostra gratuita

Baixe o primeiro dia de Engenharia de Dados na Prática

O pipeline rodou. Isso quer dizer que ele está certo? A pergunta que separa quem opera dados de quem apenas os move.

Introdução e capítulo de abertura, em PDF — com exercício, checklist de produção e pergunta de entrevista comentada.