Skip to content

Hadoop 大数据学习指南 ​

欢迎使用本套 Hadoop 生态完整学习笔记,本指南将带你从零基础开始,一步步完成三节点集群搭建、分布式存储、计算、数据仓库、分布式数据库全栈学习,配套 6 个连贯业务项目,还原企业真实大数据开发流程。

定位说明

本笔记面向大数据初学者与在校学生,以「电影网站用户影评数据」为贯穿案例,兼顾原理讲解与实操落地,适合课程同步学习、校招复习、入门转岗使用。

学前须知 ​

✅ 适合人群 ​

  • 大数据专业在校学生,配套课程同步学习
  • 想入门大数据开发的转行者
  • 有 Linux 基础,想系统学习 Hadoop 生态的运维/开发人员
  • 准备大数据校招、复习基础知识点的求职者

❌ 不适合人群 ​

  • 有 3 年以上大数据开发经验的资深从业者(内容偏基础向)
  • 完全不会 Linux 命令的纯新手(建议先补充 Linux 基础)
  • 只想了解概念、不想动手实操的学习者

🎯 学完你将掌握 ​

  • 三节点 Hadoop 完全分布式集群的搭建、配置与运维
  • HDFS 分布式文件系统的原理、命令与 Java 开发
  • MapReduce 分布式计算编程模型与性能调优
  • Hive 数据仓库 SQL 开发与分层建模
  • HBase 分布式数据库的使用、设计与集群部署
  • 6 个连贯的电影影评业务项目全流程落地

环境准备 ​

硬件配置建议 ​

推荐使用 3 台虚拟机搭建集群,每台配置如下:

配置项最低配置推荐配置说明
操作系统CentOS 7.xCentOS 7.9企业主流版本,兼容性最好
内存2 GB4 GBNameNode + ResourceManager 比较吃内存,太低容易 OOM
CPU2 核4 核并行计算场景 CPU 核心越多越好
硬盘20 GB40 GB存放安装包、数据、日志
网络仅主机模式NAT + 仅主机能连外网装软件,集群内部互通

新手避坑

不要给每台虚拟机只分配 1G 内存! Hadoop 的 NameNode、SecondaryNameNode、ResourceManager、NodeManager 一起运行,1G 内存根本扛不住,会频繁出现进程挂掉、任务卡死的问题,排查问题的时间远不如多加 1G 内存划算。

软件清单 ​

你需要提前准备好以下安装包:

组件推荐版本说明
JDK1.8.0_xxxHadoop 3.x 完美兼容 JDK8,企业最常用
Hadoop3.3.6稳定版,社区资料多,踩坑少
虚拟机软件VMware Workstation / VirtualBox推荐 VMware,网络配置更方便
终端工具Xshell / FinalShell / MobaXterm多节点批量操作必备

前置技能 ​

  • 会基础 Linux 命令:cd、ls、mkdir、scp、vi/vim、环境变量配置
  • 了解基本网络概念:IP 地址、主机名、端口
  • 有一点点编程基础更佳(Java / Scala / Python 都可以)

三步快速上手 ​

Step 1:跑通你的第一个 Hadoop 集群 ​

先跟着集群搭建章节,把三节点集群跑起来,能看到所有进程都正常启动,就算入门成功。

目标成果:

  • 3 台虚拟机网络互通,配置 SSH 免密登录
  • HDFS 正常启动:NameNode、SecondaryNameNode、DataNode 全部在线
  • YARN 正常启动:ResourceManager、NodeManager 全部在线
  • Web UI 可正常访问:50070(HDFS)、8088(YARN)端口

👉 前往学习:项目1:Hadoop 集群的搭建及配置

Step 2:跑通你的第一个 MapReduce 程序 ​

集群跑通后,跑一个经典的 WordCount 词频统计,验证分布式计算框架正常工作。

目标成果:

  • 上传文本文件到 HDFS
  • 提交 WordCount 计算任务
  • 成功输出词频统计结果
  • 在 YARN UI 上看到已完成的任务记录

👉 前往学习:WordCount 案例深度解析

Step 3:完成第一个业务项目 ​

跑通基础程序后,进入第一个真实业务场景:电影影评数据存储与统计,感受大数据解决真实问题的完整流程。

目标成果:

  • 电影影评数据上传 HDFS 结构化存储
  • 用 MapReduce 完成影评评分基础统计
  • 输出结构化统计结果文件

👉 前往学习:项目2:电影影评数据存储


完整学习路线 ​

按照「基础→存储→计算→数仓→数据库→实战」的顺序循序渐进,6 个项目环环相扣:

阶段核心内容难度预计学习时长
筑基Hadoop 集群搭建与运维⭐⭐1 天
存储HDFS 分布式文件系统⭐⭐0.5 天
计算入门MapReduce 基础编程⭐⭐⭐1.5 天
计算进阶MapReduce 多维度分析⭐⭐⭐⭐2 天
数仓Hive 数据仓库与 SQL⭐⭐⭐1.5 天
数据库HBase 分布式存储⭐⭐⭐1 天
综合全项目复盘与拓展⭐⭐⭐1 天

核心知识模块 ​

🖥️ 模块一:Hadoop 集群搭建与运维 ​

大数据的第一步:先把「分布式计算机群」搭起来,跑通三节点集群,这是后面所有操作的地基。

核心知识点:虚拟机准备、SSH免密登录、四大核心配置文件、集群角色规划、运维与排错

👉 进入模块学习

📂 模块二:HDFS 分布式文件系统 ​

大数据界的「共享网盘」:把大文件拆成固定大小的块,分散存在多台机器上,统一管理;坏一块硬盘不丢数据,文件再大也能存。

核心知识点:核心原理、Shell 命令大全、Java API 开发、高级特性、企业实践

👉 进入模块学习

⚙️ 模块三:MapReduce 分布式计算框架 ​

大数据界的「流水线工厂」:分而治之思想——把大计算任务拆成无数小任务,分给多台机器并行计算,最后汇总结果。

核心知识点:编程模型、Shuffle 机制、基础案例、进阶编程、性能调优

👉 进入模块学习

📊 模块四:Hive 数据仓库 ​

大数据界的「懒人神器」:不用手写复杂的 MapReduce 代码,写 SQL 就能做大数据分析——底层自动翻译成 MapReduce 任务运行。

核心知识点:架构原理、Hive QL 基础、高级查询、数据仓库建模、性能优化

👉 进入模块学习

🗄️ 模块五:HBase 分布式数据库 ​

海量数据的「快速存取抽屉」:专门面向海量结构化数据,按 RowKey 秒级查询,适合随机读写、实时查询场景。

核心知识点:数据模型、架构原理、Shell 操作、Java API、RowKey 设计、集群运维

👉 进入模块学习


完整项目实战清单 ​

项目编号项目名称难度核心技术项目产出
项目1Hadoop 集群的搭建及配置⭐⭐虚拟机、SSH、Hadoop 四大配置文件三节点完全分布式可用集群
项目2存储电影网站用户影评数据⭐⭐HDFS Shell、目录规划、权限管理影评数据 HDFS 存储方案
项目3统计电影网站用户影评数据⭐⭐⭐MapReduce 基础编程、WordCount 模型影评基础统计指标结果
项目4多维度分析电影网站用户影评⭐⭐⭐⭐MapReduce 进阶、二次排序、多维度聚合多维度影评分析报告
项目5基于 Hive 的电影数据仓库分析⭐⭐⭐Hive SQL、数据仓库建模、窗口函数影评数据仓库 + 多维度查询
项目6基于 HBase 存储分析结果⭐⭐⭐HBase 建表、RowKey 设计、API 读写分析结果的 HBase 存储方案

💡 学习避坑指南 ​

  1. 别上来就啃源码,先跑通集群 新手最容易踩的坑:第一天就翻 HDFS 源码,看了三天还没启动过一次集群。先把集群跑起来,传个文件,跑个 WordCount,有了体感再学原理,效率翻倍。
  2. 虚拟机别省内存,不然崩到怀疑人生 每台机器至少给 2G 内存,NameNode + ResourceManager 都吃内存;给太小的话集群动不动就挂,排查问题的时间够你多开 2G 内存了。
  3. SSH 免密是集群的灵魂 所有节点之间一定要配好免密登录,不然 scp 同步文件、启动集群每次都要输密码,烦到你想放弃。
  4. MapReduce 不是银弹 不是所有计算都要套分布式,小数据量本地算更快。MapReduce 的价值在「海量数据 + 并行计算」,别为了用而用。
  5. Hive 不是数据库 很多人以为 Hive 是数据库,其实它是「SQL 翻译器」——本身不存数据,数据都在 HDFS 上,元数据存在 MySQL 里。
  6. HBase 别乱用 不是什么数据都塞 HBase,它适合「海量数据 + 按行键快速查询」;小数据、全表扫描场景,不如直接用 MySQL。

下一步 ​

准备好了的话,就从集群搭建开始你的大数据之旅吧:

👉 开始搭建三节点 Hadoop 集群

想先了解整体生态?可以先看:

基于 Vite 强力驱动 | 纯静态轻量托管