Hadoop 大数据学习指南
欢迎使用本套 Hadoop 生态完整学习笔记,本指南将带你从零基础开始,一步步完成三节点集群搭建、分布式存储、计算、数据仓库、分布式数据库全栈学习,配套 6 个连贯业务项目,还原企业真实大数据开发流程。
定位说明
本笔记面向大数据初学者与在校学生,以「电影网站用户影评数据」为贯穿案例,兼顾原理讲解与实操落地,适合课程同步学习、校招复习、入门转岗使用。
学前须知
✅ 适合人群
- 大数据专业在校学生,配套课程同步学习
- 想入门大数据开发的转行者
- 有 Linux 基础,想系统学习 Hadoop 生态的运维/开发人员
- 准备大数据校招、复习基础知识点的求职者
❌ 不适合人群
- 有 3 年以上大数据开发经验的资深从业者(内容偏基础向)
- 完全不会 Linux 命令的纯新手(建议先补充 Linux 基础)
- 只想了解概念、不想动手实操的学习者
🎯 学完你将掌握
- 三节点 Hadoop 完全分布式集群的搭建、配置与运维
- HDFS 分布式文件系统的原理、命令与 Java 开发
- MapReduce 分布式计算编程模型与性能调优
- Hive 数据仓库 SQL 开发与分层建模
- HBase 分布式数据库的使用、设计与集群部署
- 6 个连贯的电影影评业务项目全流程落地
环境准备
硬件配置建议
推荐使用 3 台虚拟机搭建集群,每台配置如下:
| 配置项 | 最低配置 | 推荐配置 | 说明 |
|---|---|---|---|
| 操作系统 | CentOS 7.x | CentOS 7.9 | 企业主流版本,兼容性最好 |
| 内存 | 2 GB | 4 GB | NameNode + ResourceManager 比较吃内存,太低容易 OOM |
| CPU | 2 核 | 4 核 | 并行计算场景 CPU 核心越多越好 |
| 硬盘 | 20 GB | 40 GB | 存放安装包、数据、日志 |
| 网络 | 仅主机模式 | NAT + 仅主机 | 能连外网装软件,集群内部互通 |
新手避坑
不要给每台虚拟机只分配 1G 内存! Hadoop 的 NameNode、SecondaryNameNode、ResourceManager、NodeManager 一起运行,1G 内存根本扛不住,会频繁出现进程挂掉、任务卡死的问题,排查问题的时间远不如多加 1G 内存划算。
软件清单
你需要提前准备好以下安装包:
| 组件 | 推荐版本 | 说明 |
|---|---|---|
| JDK | 1.8.0_xxx | Hadoop 3.x 完美兼容 JDK8,企业最常用 |
| Hadoop | 3.3.6 | 稳定版,社区资料多,踩坑少 |
| 虚拟机软件 | VMware Workstation / VirtualBox | 推荐 VMware,网络配置更方便 |
| 终端工具 | Xshell / FinalShell / MobaXterm | 多节点批量操作必备 |
前置技能
- 会基础 Linux 命令:
cd、ls、mkdir、scp、vi/vim、环境变量配置 - 了解基本网络概念:IP 地址、主机名、端口
- 有一点点编程基础更佳(Java / Scala / Python 都可以)
三步快速上手
Step 1:跑通你的第一个 Hadoop 集群
先跟着集群搭建章节,把三节点集群跑起来,能看到所有进程都正常启动,就算入门成功。
目标成果:
- 3 台虚拟机网络互通,配置 SSH 免密登录
- HDFS 正常启动:NameNode、SecondaryNameNode、DataNode 全部在线
- YARN 正常启动:ResourceManager、NodeManager 全部在线
- Web UI 可正常访问:50070(HDFS)、8088(YARN)端口
👉 前往学习:项目1:Hadoop 集群的搭建及配置
Step 2:跑通你的第一个 MapReduce 程序
集群跑通后,跑一个经典的 WordCount 词频统计,验证分布式计算框架正常工作。
目标成果:
- 上传文本文件到 HDFS
- 提交 WordCount 计算任务
- 成功输出词频统计结果
- 在 YARN UI 上看到已完成的任务记录
👉 前往学习:WordCount 案例深度解析
Step 3:完成第一个业务项目
跑通基础程序后,进入第一个真实业务场景:电影影评数据存储与统计,感受大数据解决真实问题的完整流程。
目标成果:
- 电影影评数据上传 HDFS 结构化存储
- 用 MapReduce 完成影评评分基础统计
- 输出结构化统计结果文件
👉 前往学习:项目2:电影影评数据存储
完整学习路线
按照「基础→存储→计算→数仓→数据库→实战」的顺序循序渐进,6 个项目环环相扣:
| 阶段 | 核心内容 | 难度 | 预计学习时长 |
|---|---|---|---|
| 筑基 | Hadoop 集群搭建与运维 | ⭐⭐ | 1 天 |
| 存储 | HDFS 分布式文件系统 | ⭐⭐ | 0.5 天 |
| 计算入门 | MapReduce 基础编程 | ⭐⭐⭐ | 1.5 天 |
| 计算进阶 | MapReduce 多维度分析 | ⭐⭐⭐⭐ | 2 天 |
| 数仓 | Hive 数据仓库与 SQL | ⭐⭐⭐ | 1.5 天 |
| 数据库 | HBase 分布式存储 | ⭐⭐⭐ | 1 天 |
| 综合 | 全项目复盘与拓展 | ⭐⭐⭐ | 1 天 |
核心知识模块
🖥️ 模块一:Hadoop 集群搭建与运维
大数据的第一步:先把「分布式计算机群」搭起来,跑通三节点集群,这是后面所有操作的地基。
核心知识点:虚拟机准备、SSH免密登录、四大核心配置文件、集群角色规划、运维与排错
👉 进入模块学习
📂 模块二:HDFS 分布式文件系统
大数据界的「共享网盘」:把大文件拆成固定大小的块,分散存在多台机器上,统一管理;坏一块硬盘不丢数据,文件再大也能存。
核心知识点:核心原理、Shell 命令大全、Java API 开发、高级特性、企业实践
👉 进入模块学习
⚙️ 模块三:MapReduce 分布式计算框架
大数据界的「流水线工厂」:分而治之思想——把大计算任务拆成无数小任务,分给多台机器并行计算,最后汇总结果。
核心知识点:编程模型、Shuffle 机制、基础案例、进阶编程、性能调优
👉 进入模块学习
📊 模块四:Hive 数据仓库
大数据界的「懒人神器」:不用手写复杂的 MapReduce 代码,写 SQL 就能做大数据分析——底层自动翻译成 MapReduce 任务运行。
核心知识点:架构原理、Hive QL 基础、高级查询、数据仓库建模、性能优化
👉 进入模块学习
🗄️ 模块五:HBase 分布式数据库
海量数据的「快速存取抽屉」:专门面向海量结构化数据,按 RowKey 秒级查询,适合随机读写、实时查询场景。
核心知识点:数据模型、架构原理、Shell 操作、Java API、RowKey 设计、集群运维
👉 进入模块学习
完整项目实战清单
| 项目编号 | 项目名称 | 难度 | 核心技术 | 项目产出 |
|---|---|---|---|---|
| 项目1 | Hadoop 集群的搭建及配置 | ⭐⭐ | 虚拟机、SSH、Hadoop 四大配置文件 | 三节点完全分布式可用集群 |
| 项目2 | 存储电影网站用户影评数据 | ⭐⭐ | HDFS Shell、目录规划、权限管理 | 影评数据 HDFS 存储方案 |
| 项目3 | 统计电影网站用户影评数据 | ⭐⭐⭐ | MapReduce 基础编程、WordCount 模型 | 影评基础统计指标结果 |
| 项目4 | 多维度分析电影网站用户影评 | ⭐⭐⭐⭐ | MapReduce 进阶、二次排序、多维度聚合 | 多维度影评分析报告 |
| 项目5 | 基于 Hive 的电影数据仓库分析 | ⭐⭐⭐ | Hive SQL、数据仓库建模、窗口函数 | 影评数据仓库 + 多维度查询 |
| 项目6 | 基于 HBase 存储分析结果 | ⭐⭐⭐ | HBase 建表、RowKey 设计、API 读写 | 分析结果的 HBase 存储方案 |
💡 学习避坑指南
- 别上来就啃源码,先跑通集群 新手最容易踩的坑:第一天就翻 HDFS 源码,看了三天还没启动过一次集群。先把集群跑起来,传个文件,跑个 WordCount,有了体感再学原理,效率翻倍。
- 虚拟机别省内存,不然崩到怀疑人生 每台机器至少给 2G 内存,NameNode + ResourceManager 都吃内存;给太小的话集群动不动就挂,排查问题的时间够你多开 2G 内存了。
- SSH 免密是集群的灵魂 所有节点之间一定要配好免密登录,不然 scp 同步文件、启动集群每次都要输密码,烦到你想放弃。
- MapReduce 不是银弹 不是所有计算都要套分布式,小数据量本地算更快。MapReduce 的价值在「海量数据 + 并行计算」,别为了用而用。
- Hive 不是数据库 很多人以为 Hive 是数据库,其实它是「SQL 翻译器」——本身不存数据,数据都在 HDFS 上,元数据存在 MySQL 里。
- HBase 别乱用 不是什么数据都塞 HBase,它适合「海量数据 + 按行键快速查询」;小数据、全表扫描场景,不如直接用 MySQL。
下一步
准备好了的话,就从集群搭建开始你的大数据之旅吧:
想先了解整体生态?可以先看: