Apache Spark. Архитектура # 3
В этом видео вы узнаете, что происходит внутри Spark, когда вы запускаете даже самый простой код вроде df.count(). Это не «магия» и не «быстрый Pandas» — это распределённая система со строгой внутренней архитектурой. Разбираем: Три ключевые роли: Driver, Executor, Cluster Manager — кто что делает и где живёт Как данные разбиваются на партиции и как это обеспечивает параллелизм Краткий обзор трёх уровней Spark API: RDD, DataFrame/Dataset, Structured Streaming Таймкоды: 00:00 Приветствие 00:55 Где мы сейчас? 01:46 Spark как система 02:44 Driver, Executor, Cluster Manager 04:31 Архитектурная схема Spark 09:50 DAG и Stage'ы 14:18 Почему shuffle - это дорого! 17:25 Три уровня Spark API 19:08 Три ключевые мысли 20:20 Заключительное слово В следующей лекции: SparkContext и SparkSession — как управлять Spark’ом программно. Презентация, как и все материалы доступна в : https://github.com/MaratNotes/marat_notes/tree/master/how_data_works-practice_cases/18_spark_architecture #spark #pyspark #bigdata #dataengineering #обучение #maratnotes
Название:
Apache Spark. Архитектура # 3
Категория:
Разное