Spark in Action, Second Edition
Autor Jean-Georges Perrinen Limba Engleză Paperback – 22 iun 2020
Dacă Beginning Apache Spark 2 v-a oferit cadrul teoretic și o introducere în ecosistemul Hadoop, Spark in Action, Second Edition oferă instrumentele practice necesare pentru a construi soluții de producție robuste. Suntem de părere că această lucrare se distinge clar în peisajul tehnic prin orientarea sa către inginerii software și de date, nu doar către cercetătorii de date. În timp ce alte resurse se concentrează pe limbaje precum Python sau R, Jean-Georges Perrin mizează pe utilizarea competențelor solide de Java și SQL pentru a stăpâni procesarea distribuită. Analizând structura celor 576 de pagini, observăm o abordare pragmatică a platformei Spark. Volumul detaliază ingestia de date din surse diverse, procesarea prin fluxuri (streaming) și utilizarea evaluării întârziate (lazy evaluation) pentru optimizarea performanței. Apreciem modul în care autorul integrează concepte avansate de învățare automată fără a sacrifica rigoarea inginerească. Această ediție a doua reflectă evoluția autorului, care în alte lucrări precum Implementing Data Mesh sau Architecture Modernization, pune accent pe alinierea socio-tehnică și structuri de date scalabile. Aici, focalizarea este strictă pe viteză și eficiență operațională. Comparativ cu High Performance Spark, care este un ghid de optimizare fină, lucrarea de față acționează ca un manual complet de construcție, de la zero la implementări complexe. Ritmul este alert, axat pe scenarii reale, oferind cititorului capacitatea de a procesa seturi masive de date fără a fi nevoie să învețe un ecosistem de instrumente complet nou. Este o resursă tehnică ce transformă teoria procesării paralele într-un activ practic imediat pentru orice echipă de dezvoltare.
Preț: 367.85 lei
Preț vechi: 459.82 lei
-20%
Carte disponibilă
Livrare economică 26 septembrie-10 octombrie
Livrare express 15-19 septembrie pentru 58.97 lei
Specificații
ISBN-10: 1617295523
Pagini: 576
Dimensiuni: 187 x 233 x 31 mm
Greutate: 1.07 kg
Ediția:2. Auflage
Editura: Manning Publications
De ce să citești această carte
Recomandăm această carte inginerilor Java care doresc să treacă la procesarea Big Data fără a reînvăța fundamentele programării. Veți câștiga o înțelegere profundă a modului în care Spark gestionează volume uriașe de date în timp real și veți învăța să aplicați SQL pentru analize complexe. Este alegerea ideală pentru cei care pun preț pe eficiența codului și pe integrarea rapidă în fluxurile de lucru de inginerie existente.
Despre autor
Jean-Georges Perrin este un expert recunoscut în arhitectura datelor și modernizarea sistemelor software, fiind autorul unor lucrări de referință precum Implementing Data Mesh și Architecture Modernization. Experiența sa vastă în coordonarea echipelor tehnice și în facilitarea workshop-urilor de strategie se reflectă în claritatea cu care explică tehnologiile complexe. În cadrul Manning Publications, el s-a impus ca o voce autoritară pentru comunitatea de ingineri software, promovând soluții scalabile și alinierea structurilor de date cu obiectivele de business.
Descriere scurtă
The Spark distributed data processing platform provides an easy-to-implement tool for ingesting, streaming, and processing data from any source. In Spark in Action, Second Edition, you’ll learn to take advantage of Spark’s core features and incredible processing speed, with applications including real-time computation, delayed evaluation, and machine learning. Spark skills are a hot commodity in enterprises worldwide, and with Spark’s powerful and flexible Java APIs, you can reap all the benefits without first learning Scala or Hadoop.
Foreword by Rob Thomas.
About the technology
Analyzing enterprise data starts by reading, filtering, and merging files and streams from many sources. The Spark data processing engine handles this varied volume like a champ, delivering speeds 100 times faster than Hadoop systems. Thanks to SQL support, an intuitive interface, and a straightforward multilanguage API, you can use Spark without learning a complex new ecosystem.
About the book
Spark in Action, Second Edition, teaches you to create end-to-end analytics applications. In this entirely new book, you’ll learn from interesting Java-based examples, including a complete data pipeline for processing NASA satellite data. And you’ll discover Java, Python, and Scala code samples hosted on GitHub that you can explore and adapt, plus appendixes that give you a cheat sheet for installing tools and understanding Spark-specific terms.
What's inside
Writing Spark applications in Java
Spark application architecture
Ingestion through files, databases, streaming, and Elasticsearch
Querying distributed datasets with Spark SQL
About the reader
This book does not assume previous experience with Spark, Scala, or Hadoop.
About the author
Jean-Georges Perrin is an experienced data and software architect. He is France’s first IBM Champion and has been honored for 12 consecutive years.
Table of Contents
PART 1 - THE THEORY CRIPPLED BY AWESOME EXAMPLES
1 So, what is Spark, anyway?
2 Architecture and flow
3 The majestic role of the dataframe
4 Fundamentally lazy
5 Building a simple app for deployment
6 Deploying your simple app
PART 2 - INGESTION
7 Ingestion from files
8 Ingestion from databases
9 Advanced ingestion: finding data sources and building
your own
10 Ingestion through structured streaming
PART 3 - TRANSFORMING YOUR DATA
11 Working with SQL
12 Transforming your data
13 Transforming entire documents
14 Extending transformations with user-defined functions
15 Aggregating your data
PART 4 - GOING FURTHER
16 Cache and checkpoint: Enhancing Spark’s performances
17 Exporting data and building full data pipelines
18 Exploring deployment