Skip to content

1. Spark 集群物理架构图 ​

说明:

  • Master 负责整个集群的资源管理和任务调度。
  • Worker 负责管理本机资源。
  • Executor 是真正执行 Task 的进程。

2. Spark 核心角色关系图 ​

说明:

  • 一个 Application 对应一个 Driver。
  • Driver 负责调度,Executor 负责执行。
  • Task 是 Spark 最小执行单元。

3. 宽窄依赖对比图 ​

说明:

  • 窄依赖:一个父分区只对应一个子分区。
  • 宽依赖:父分区数据需要重新分配,会触发 Shuffle。

4. Stage 划分原理图 ​

说明:

  • 遇到 Shuffle 算子,Spark 会切分 Stage。
  • Stage 内部可以流水线执行。
  • Stage 之间顺序执行。

5. WordCount 执行流程图 ​

说明:

  • 这是 Spark 最经典的入门案例。
  • 核心流程:读取 → 切分 → 标记 → 分组 → 聚合 → 输出。

6. RDD 惰性求值图 ​

说明:

  • map、filter、flatMap 等是转换算子。
  • collect、count、saveAsTextFile 等是行动算子。
  • 只有遇到 Action,Spark 才真正开始计算。

7. Spark 任务运行流程图 ​

说明:

  • 任务提交后,Master 先分配资源。
  • Driver 负责生成逻辑计划和物理计划。
  • Executor 负责真正执行计算任务。

8. Spark 技术栈全景图 ​

说明:

  • Spark Core 是底层核心。
  • Spark SQL、Streaming、MLlib、GraphX 都是上层组件。
  • 它们都建立在 RDD 和统一调度引擎之上。

9. Spark 运行模式图 ​

说明:

  • Local:单机调试。
  • Standalone:Spark 自带集群。
  • YARN:企业生产常用。
  • Kubernetes:云原生部署。

10. RDD 五特性简化图 ​

说明:

  • 分区:数据可以并行处理。
  • 依赖:记录 RDD 之间的关系。
  • 分区器:决定 Key 如何分配。
  • 优先位置:计算尽量靠近数据。

如果还报错,我建议你优先用这一版最稳的 Spark 任务运行流程图:

这版结构最简单,基本不会渲染失败。

基于 Vite 强力驱动 | 纯静态轻量托管