1. Spark 集群物理架构图
说明:
- Master 负责整个集群的资源管理和任务调度。
- Worker 负责管理本机资源。
- Executor 是真正执行 Task 的进程。
2. Spark 核心角色关系图
说明:
- 一个 Application 对应一个 Driver。
- Driver 负责调度,Executor 负责执行。
- Task 是 Spark 最小执行单元。
3. 宽窄依赖对比图
说明:
- 窄依赖:一个父分区只对应一个子分区。
- 宽依赖:父分区数据需要重新分配,会触发 Shuffle。
4. Stage 划分原理图
说明:
- 遇到 Shuffle 算子,Spark 会切分 Stage。
- Stage 内部可以流水线执行。
- Stage 之间顺序执行。
5. WordCount 执行流程图
说明:
- 这是 Spark 最经典的入门案例。
- 核心流程:读取 → 切分 → 标记 → 分组 → 聚合 → 输出。
6. RDD 惰性求值图
说明:
- map、filter、flatMap 等是转换算子。
- collect、count、saveAsTextFile 等是行动算子。
- 只有遇到 Action,Spark 才真正开始计算。
7. Spark 任务运行流程图
说明:
- 任务提交后,Master 先分配资源。
- Driver 负责生成逻辑计划和物理计划。
- Executor 负责真正执行计算任务。
8. Spark 技术栈全景图
说明:
- Spark Core 是底层核心。
- Spark SQL、Streaming、MLlib、GraphX 都是上层组件。
- 它们都建立在 RDD 和统一调度引擎之上。
9. Spark 运行模式图
说明:
- Local:单机调试。
- Standalone:Spark 自带集群。
- YARN:企业生产常用。
- Kubernetes:云原生部署。
10. RDD 五特性简化图
说明:
- 分区:数据可以并行处理。
- 依赖:记录 RDD 之间的关系。
- 分区器:决定 Key 如何分配。
- 优先位置:计算尽量靠近数据。
如果还报错,我建议你优先用这一版最稳的 Spark 任务运行流程图:
这版结构最简单,基本不会渲染失败。