Skip to content

AIGC 完整入门教程(上):基础、原理与模型全景 ​

面向人群:从零基础到 10 年+ IT 老兵。本文不做"AI 会取代人类"的鸡汤,只讲技术本质、工程取舍和认知框架。

阅读建议:有 ML 基础的读者可跳过第 1 节直接看第 3 节;纯产品/运营读者重点看第 1、2、5 节。


目录 ​

  1. AIGC 到底是什么:一次概念考古
  2. 核心技术栈全景:从神经网络到生成模型
  3. 三大生成范式深度对比:GAN / VAE / Diffusion / Autoregressive
  4. Transformer 架构硬核拆解
  5. 主流大模型横向对比(2026 年中版)
  6. 关键概念速查表:Token / 上下文 / 微调 / RAG / Agent
  7. AIGC 的模态版图
  8. 本篇小结与中篇预告

1. AIGC 到底是什么:一次概念考古 ​

1.1 定义的演进 ​

AIGC(AI Generated Content,人工智能生成内容)这个词在 2022 年之前几乎只出现在学术论文里。2022 年底 ChatGPT 发布后,它被媒体和产业界迅速征用,用来指代"所有由 AI 自动生成的文本、图像、音频、视频、代码、3D 模型等内容"。

但如果你在 2018 年问一个 NLP 研究者"AIGC 是什么",他可能会说:"你是说 NLG(Natural Language Generation)吗?"

概念谱系:

UGC (User Generated Content)  → 用户生产内容(微博、抖音)
PGC (Professional Generated Content) → 专业生产内容(电影、新闻)
AIGC (AI Generated Content) → AI 生产内容(ChatGPT、Midjourney)
    └─ 细分:
       ├─ NLG(自然语言生成)
       ├─ T2I(文生图)
       ├─ TTS(文生语音)
       ├─ T2V(文生视频)
       └─ Code Gen(代码生成)

1.2 为什么是"现在"爆发? ​

AIGC 不是突然出现的技术奇迹,而是三条曲线在 2022 年交汇的结果:

维度2018 年2022 年2026 年
模型参数GPT-2: 1.5BGPT-3: 175B万亿级 MoE
训练数据几十 GB数 TB全网级 + 合成数据
算力成本$10M 级$100M 级$1B+ 级
推理成本不可商用可商用但贵边际成本趋零
用户体验API onlyChat 对话多模态 Agent

核心洞察:AIGC 的爆发本质是"算力性价比"跨越了商用临界点。2018 年生成一段高质量文本要几美元,2026 年只要几厘钱。当边际成本低于人工成本时,替代就不可逆了。

1.3 一个容易被忽略的区分:生成 vs 判别 ​

很多人以为 AI = AIGC,其实 AI 领域长期分为两大阵营:

  • 判别模型(Discriminative):给输入,判断类别。比如"这张图是猫还是狗"、"这封邮件是不是垃圾邮件"。代表:ResNet、BERT。
  • 生成模型(Generative):学习数据分布,然后采样出新样本。比如"画一只猫"、"写一首诗"。代表:GPT、Stable Diffusion。

AIGC 用的是生成模型。但有趣的是,很多生成模型内部都依赖判别组件——比如 GAN 里的 Discriminator、Diffusion 里的噪声预测网络本质也是在做"判别这是不是真实数据分布"。生成和判别的边界,在深度学习里从来不是非黑即白。


2. 核心技术栈全景:从神经网络到生成模型 ​

2.1 一张图看懂 AIGC 技术栈 ​

┌─────────────────────────────────────────────────────┐
│                   应用层 (Application)               │
│   ChatGPT / Midjourney / Sora / Copilot / 各种 Agent  │
├─────────────────────────────────────────────────────┤
│                   模型层 (Model)                     │
│   LLM / Diffusion / VAE / GAN / Flow Matching       │
├─────────────────────────────────────────────────────┤
│                 架构层 (Architecture)                │
│          Transformer / U-Net / Mamba / RNN           │
├─────────────────────────────────────────────────────┤
│                 训练层 (Training)                    │
│   预训练 / SFT / RLHF / DPO / LoRA / 蒸馏 / 量化      │
├─────────────────────────────────────────────────────┤
│                 基础设施层 (Infra)                   │
│   GPU 集群 / 分布式训练 / 推理引擎 / 向量数据库        │
└─────────────────────────────────────────────────────┘

2.2 为什么 Transformer 成了通用架构? ​

2017 年 Google 发表《Attention Is All You Need》时,没人想到这篇论文会在 5 年内统一 NLP、CV、音频、蛋白质结构预测等几乎所有领域。

Transformer 的核心创新只有一个:自注意力机制(Self-Attention)。它让模型在处理任意一个 token 时,都能直接"看到"序列中所有其他 token,并动态决定关注谁、忽略谁。

对比之前的主流架构:

架构处理长序列并行训练远程依赖代表模型
RNN/LSTM慢,逐步递推不能并行弱(梯度消失)ELMo
CNN快,局部卷积可并行弱(感受野有限)TextCNN
Transformer快,全局注意力完全并行强(直接连接)GPT/BERT

对 IT 老兵的类比:RNN 像单线程串行执行,Transformer 像 SIMD 并行计算。GPU 天生喜欢后者。

2.3 从预训练到对齐:大模型的四阶段训练 ​

一个现代 LLM 的诞生通常经历四个阶段:

阶段1: 预训练 (Pre-training)
  输入:TB 级文本语料
  目标:下一个 token 预测
  产物:"什么都懂但不会聊天"的基础模型
  成本:$10M ~ $1B+

阶段2: 监督微调 (SFT, Supervised Fine-Tuning)
  输入:几万~几十万条人工标注的"指令-回答"对
  目标:学会遵循指令
  产物:会聊天但可能胡说的模型
  成本:$10K ~ $1M

阶段3: 人类反馈强化学习 (RLHF)
  输入:人工对模型回答的偏好排序
  目标:对齐人类价值观,输出更有用/安全
  产物:ChatGPT 级体验
  成本:$100K ~ $10M

阶段4: 安全与拒答微调
  输入:安全红线测试集
  目标:拒绝有害请求
  产物:可商用的对齐模型

关键认知:你日常用的 ChatGPT,其"智能"主要来自阶段 1,其"好用"主要来自阶段 2-3。很多开源模型只做到阶段 1-2,所以"智商不低但体验差"。


3. 三大生成范式深度对比:GAN / VAE / Diffusion / Autoregressive ​

这是本文最硬核的一节。如果你只能记住一节,记住这节。

3.1 四种生成范式的本质区别 ​

所有生成模型都在解决同一个数学问题:学习训练数据的概率分布 P_data(x),然后从中采样出新样本 x ~ P_model(x)。

但它们走了四条完全不同的路:

3.1.1 GAN(生成对抗网络)—— 博弈论路线 ​

核心思想:两个网络互相对抗。

  • 生成器 G:把随机噪声 z 变成假样本 G(z)
  • 判别器 D:判断一个样本是真的还是假的
  • 训练过程:G 努力骗过 D,D 努力不被骗,最终达到纳什均衡

优点:生成质量高、推理快(一次前向传播) 缺点:训练不稳定(模式崩溃 mode collapse)、难以收敛 代表:StyleGAN(人脸生成)、CycleGAN(风格迁移)

类比:GAN 像造假币者和警察的博弈。造假币者技术越来越高,警察鉴别能力也越来越强,最终假币逼真到警察也分不清。

3.1.2 VAE(变分自编码器)—— 概率图模型路线 ​

核心思想:编码器把输入 x 压缩成潜在分布 q(z|x),解码器从 z 重建 x。用变分推断最大化证据下界(ELBO)。

优点:训练稳定、有结构化的潜在空间(可做插值、属性编辑) 缺点:生成结果偏模糊(因为用了像素级 MSE 损失) 代表:VQ-VAE、VQ-GAN(后来成为 Stable Diffusion 的潜空间基础)

类比:VAE 像一个"有损压缩器",它学会了把图片压缩成一组数字(潜在向量),再解压回来。生成新图时,随机选一组数字解压即可。

3.1.3 Diffusion(扩散模型)—— 热力学路线 ​

核心思想:分两步。

  • 前向过程:逐步给真实图片加高斯噪声,直到变成纯噪声(T 步,T 通常 1000)
  • 反向过程:训练一个 U-Net 学习"去噪",从纯噪声逐步还原出图片

数学上,扩散模型在做分数匹配(score matching),即学习数据分布的梯度 ∇_x log P(x)。

优点:生成质量极高、训练稳定、模式覆盖好 缺点:推理慢(需要多步去噪,虽然有 DDIM 等加速方法) 代表:DDPM、Stable Diffusion、DALL·E 3、Midjourney(内部疑似混合架构)

类比:Diffusion 像把一块精美的冰雕慢慢融化成水(前向加噪),然后训练一个"逆向魔法师"学会把水重新冻成冰雕(反向去噪)。生成新冰雕时,从一池水开始,让魔法师一步步冻回去。

3.1.4 Autoregressive(自回归)—— 概率论路线 ​

核心思想:把生成问题分解为条件概率的链式乘积: P(x) = P(x₁) · P(x₂|x₁) · P(x₃|x₁,x₂) · ... · P(x_T|x₁,...,x_{T-1})

每次只预测下一个 token,循环直到结束。

优点:理论简洁、训练稳定、长文本生成的事实标准 缺点:推理不能并行(必须逐个生成)、误差累积 代表:GPT 系列、LLaMA、Claude

类比:Autoregressive 像一个人逐字写文章,每个字都基于前面已经写的内容来决定。

3.2 四范式横向对比表 ​

维度GANVAEDiffusionAutoregressive
训练稳定性差好好好
生成质量高中(偏模糊)极高高(文本)/中(图像)
推理速度极快快慢(可加速)慢(串行)
模式覆盖差(易崩溃)好极好好
潜在空间可解释性中极好中差
主要应用图像增强、风格迁移表征学习、图像编辑文生图、视频生成文本、代码、对话
2026 年热度下降被 Diffusion 吸收主流主流(LLM 基座)

3.3 一个反直觉的事实 ​

2024 年后,Diffusion 和 Autoregressive 正在融合。比如:

  • Stable Diffusion 3 采用了 MM-DiT 架构,本质是 Transformer + Diffusion
  • Sora 用 Diffusion Transformer(DiT)做视频生成
  • 一些新模型用 Autoregressive 生成离散 token,再用 VAE 解码成图像(如 VQ-Diffusion、MUSE)

技术路线的竞争最终往往走向融合,而不是一方消灭另一方。这和操作系统之争、编程语言之争如出一辙。


4. Transformer 架构硬核拆解 ​

4.1 自注意力的数学本质 ​

给定输入序列 X ∈ ℝ^{n×d}(n 个 token,每个 d 维),自注意力计算如下:

Q = X · W_Q    (Query,"我在找什么")
K = X · W_K    (Key,"我有什么")
V = X · W_V    (Value,"我的内容")

Attention(Q,K,V) = softmax(QK^T / √d_k) · V

直觉解释:

  • 每个 token 生成一个 Query("我需要什么信息")
  • 每个 token 生成一个 Key("我能提供什么信息")
  • Q 和 K 的点积 = 相关性分数
  • softmax 归一化后,对所有 token 的 Value 做加权求和

为什么除以 √d_k? 防止点积过大导致 softmax 梯度消失。这是工程细节,但没有它 Transformer 训练不起来。

4.2 多头注意力(Multi-Head Attention) ​

不是只做一次注意力,而是做 h 次(h=8/16/32/96...),每次用不同的 Q/K/V 投影矩阵,最后拼接起来。

为什么需要多头? 不同头可以学习不同类型的关注模式:

  • 头 1:关注语法依赖(主谓宾关系)
  • 头 2:关注指代消解("它"指什么)
  • 头 3:关注位置邻近关系
  • 头 4:关注语义相似性

类比:多头注意力像一个团队里有多个分析师,每个人从不同角度分析同一份材料,最后汇总结论。

4.3 位置编码:Transformer 如何知道顺序? ​

自注意力本身是"排列不变"的——打乱 token 顺序,输出也只是对应打乱,模型本身不知道谁在前谁在后。所以需要**位置编码(Positional Encoding)**注入顺序信息。

主流方案:

方案原理代表模型优缺点
绝对正弦位置编码sin/cos 函数生成固定位置向量原始 Transformer、BERT简单,但外推性差
可学习位置编码直接训练位置嵌入向量GPT-2灵活,但长度固定
RoPE(旋转位置编码)对 Q/K 做旋转,注入相对位置LLaMA、Qwen外推性好,长文本首选
ALiBi注意力分数直接加位置偏置BLOOM简单有效,长文本友好

2026 年现状:RoPE 基本成为开源 LLM 的标准选择。对长上下文(128K+)的支持是当前竞争焦点。

4.4 前馈网络(FFN)的隐藏角色 ​

Transformer Block 里除了注意力,还有一个两层的 MLP(前馈网络):

FFN(x) = max(0, x·W₁ + b₁) · W₂ + b₂

看起来不起眼,但研究表明:

  • FFN 占了 Transformer 约 2/3 的参数量
  • FFN 被认为是模型的"记忆存储"——知识以键值对的形式存在 FFN 的权重里
  • 注意力负责"路由"(找到相关信息),FFN 负责"检索+计算"(输出具体内容)

这个"记忆-路由"的视角,是理解 LLM 工作机制的关键钥匙之一。

4.5 从 Decoder-only 到统一架构 ​

GPT 用的是 Decoder-only 架构(只有解码器,没有编码器),而原始 Transformer 论文是 Encoder-Decoder 架构。为什么?

架构类型代表特点适合任务
Encoder-onlyBERT双向注意力,理解强但不能生成分类、NER、情感分析
Decoder-onlyGPT、LLaMA单向因果注意力,生成为主对话、写作、代码
Encoder-DecoderT5、BART编码理解+解码生成翻译、摘要

为什么 Decoder-only 赢了? 三个原因:

  1. 规模化效应更好:随着参数和数据增加,Decoder-only 的 loss 下降更平滑
  2. 零样本能力强:预训练即"续写",天然适配各种下游任务
  3. 工程简单:一种架构统一所有任务,不需要针对任务改结构

2024 年后,Mamba 等状态空间模型(SSM) 开始挑战 Transformer 的地位,它们在长序列上有线性复杂度优势。但截至 2026 年中,Transformer 仍是绝对主流,SSM 更多以"混合架构"(如 Mamba-Transformer 混合层)的形式出现。


5. 主流大模型横向对比(2026 年中版) ​

5.1 闭源第一梯队 ​

模型开发商发布时间参数量(估)上下文多模态突出能力短板
GPT-5OpenAI2025未公开(万亿级MoE)1M全模态推理、Agent、代码贵、速率限制
Claude 4Anthropic2025未公开200K→1M文本+图像长文本、安全、写作速度一般
Gemini 3Google2025未公开1M+全模态多模态、搜索整合中文一般
豆包 4.0字节跳动2025未公开256K全模态中文、性价比、生态国际认知度低
通义千问 3阿里2025未公开1M全模态中文、企业服务创意写作一般
文心一言 4.5百度2025未公开128K全模态中文、搜索生态封闭

5.2 开源主流模型 ​

模型开发商参数量许可证特点
LLaMA 3.1Meta8B/70B/405B商用友好生态最丰富,微调方案多
Qwen 3阿里0.6B~72BApache 2.0中文最强开源,全尺寸覆盖
DeepSeek V3深度求索671B MoEMIT推理能力强,性价比极高
Mistral Large 2Mistral123B商用友好欧洲代表,效率高
Phi 4Microsoft14BMIT小模型天花板,适合端侧

5.3 选择模型的决策框架 ​

不要问"哪个模型最好",要问"哪个模型最适合我的场景":

预算充足 + 要最强能力 → GPT-5 / Claude 4
中文为主 + 性价比 → 豆包 / 通义 / Qwen
需要本地部署 + 数据敏感 → Qwen / DeepSeek / LLaMA
端侧/边缘部署 → Phi 4 / Qwen 1.8B / 量化后的 7B 模型
长文档处理(法律/医疗) → Claude 4 / 通义(1M 上下文)
代码生成 → GPT-5 / Claude 4 / DeepSeek Coder
Agent / 工具调用 → GPT-5 / 豆包

5.4 一个 IT 老兵的实用建议 ​

  1. 不要迷信榜单:MMLU、GSM8K 等基准分数和实际体验相关性有限。自己的业务数据上跑一遍才是真理。
  2. 小模型 + 好提示词 > 大模型 + 烂提示词:很多场景下 7B 模型用对了提示词,效果超过 70B 模型的默认输出。
  3. API 成本是隐性陷阱:GPT-5 的输入 $10/M tokens、输出 $30/M tokens 看起来便宜,但批量处理时账单会爆炸。做成本预估时按 10 倍冗余算。
  4. 开源模型的真正价值不是免费:是可控、可定制、可离线。如果你的业务不需要这些,闭源 API 往往更划算。

6. 关键概念速查表:Token / 上下文 / 微调 / RAG / Agent ​

6.1 Token:大模型的"原子单位" ​

大模型不直接处理文字,而是处理 Token(词元)。

  • 1 个英文单词 ≈ 1.3 个 token
  • 1 个中文字 ≈ 1.5-2 个 token(不同分词器差异大)
  • 1000 个 token ≈ 750 个英文单词 ≈ 500 个中文字

为什么用 Token 而不是字或词?

  • 用字:序列太长,计算量爆炸
  • 用词:词表太大,OOV(未登录词)问题严重
  • 用 Token(BPE/WordPiece 等子词分词):在序列长度和词表大小之间取最优平衡

工程影响:

  • API 计费按 token 算
  • 上下文窗口限制按 token 算
  • 推理速度按 token/s 算
  • 你输入的 prompt 越长,花的钱越多、越慢

6.2 上下文窗口(Context Window) ​

模型一次能"看到"的最大 token 数。

代际上下文长度能装下什么
2020 GPT-32K一篇短文
2023 GPT-48K/32K一篇论文 / 一章书
2024 GPT-4o128K一本书
2025-20261M+一部法典 / 整个代码库

注意:上下文窗口 ≠ 有效记忆。很多模型标称 128K 上下文,但在 64K 之后的"大海捞针"准确率会急剧下降。有效上下文才是关键指标。

6.3 微调(Fine-tuning)vs RAG vs Prompt Engineering ​

这是三种让模型适配特定场景的方法,经常被混淆:

方法原理成本知识更新适合场景
Prompt Engineering在输入里给指令和示例极低实时通用任务、快速验证
RAG检索外部文档拼入 prompt中实时知识库问答、文档摘要
微调用领域数据继续训练模型高需重新训练风格迁移、特定格式、性能极致优化

决策树:

你的需求是什么?
├─ 让模型回答特定知识 → RAG(优先)
├─ 让模型按特定格式/风格输出 → 少样本提示词 → 不行再微调
├─ 让模型学会新能力(如代码生成特定框架)→ 微调
└─ 只是通用对话 → 什么都不用,直接用

6.4 Agent:从"问答"到"行动" ​

Agent(智能体)是 2024-2026 年最火的概念。核心区别:

  • 普通 LLM:你问,它答。对话结束,什么都不会发生。
  • Agent:你给目标,它自己规划、调用工具、执行、观察结果、再调整,直到完成目标。

Agent 的核心循环(ReAct 范式):

Thought(思考)→ Action(行动/调用工具)→ Observation(观察结果)
     ↑                                              ↓
     └──────────────── 循环直到完成 ────────────────┘

Agent 的能力边界:

  • 能做:信息检索、代码执行、API 调用、多步推理、文件操作
  • 不能做:需要物理世界交互的事(除非接机器人)、需要人类判断的高风险决策
  • 常见失败:工具调用错误、陷入循环、无法处理异常、成本失控

中篇会详细讲 Agent 的工程实践。


7. AIGC 的模态版图 ​

7.1 文本(Text) ​

最成熟的模态。技术路线:Autoregressive Transformer。

应用:对话、写作、翻译、摘要、代码、知识问答。

前沿方向:长上下文(1M+)、推理增强(o1 类思维链)、多语言、低资源语言。

7.2 图像(Image) ​

2022 年 Stable Diffusion 开源后爆发。技术路线:Diffusion + Transformer(DiT)。

模型类型特点
Midjourney v7闭源审美天花板,创意设计首选
DALL·E 3闭源文字理解强,和 ChatGPT 整合好
Stable Diffusion 3.5开源可控性强,生态丰富,可本地部署
Flux开源2024 年黑马,质量接近 Midjourney
即梦 / 可灵国产中文 prompt 理解好,性价比高

关键技术:ControlNet(控制姿态/深度/边缘)、LoRA(风格/角色定制)、Inpainting(局部重绘)、Img2Img(图生图)。

7.3 音频(Audio) ​

包括语音合成(TTS)、音乐生成、音效生成。

  • TTS:ElevenLabs(音色克隆天花板)、ChatTTS(开源中文)、CosyVoice(阿里开源)
  • 音乐:Suno(流行歌生成)、Udio(高质量音乐)、Stable Audio
  • 语音克隆:只需几秒样本即可克隆音色,但也带来深度伪造风险

7.4 视频(Video) ​

2024 年 Sora 发布后成为新战场。技术路线:Diffusion Transformer + 时空注意力。

模型时长分辨率特点
Sora60s+1080p物理一致性最好
Runway Gen-416s4K电影级质感
Pika 310s1080p创意风格强
可灵 / 即梦视频10s1080p国产代表,中文理解好
Vidu8s1080p生数科技,角色一致性好

核心挑战:时序一致性(物体不闪烁/变形)、物理合理性、长视频生成、可控性。

7.5 3D 与其他 ​

  • 3D 生成:DreamFusion、Instant3D、TripoSR——从文本/图片生成 3D 模型,游戏和元宇宙的关键技术
  • 代码生成:GitHub Copilot、Cursor、Claude Code——已经在改变软件开发方式
  • 科学发现:AlphaFold(蛋白质结构)、AI 辅助材料发现、AI for Science
  • 具身智能:把大模型接入机器人,让 AI 拥有物理行动能力

8. 本篇小结与中篇预告 ​

核心要点回顾 ​

  1. AIGC 的本质是生成模型学习数据分布后采样新样本,不是"搜索"也不是"拼接"。
  2. 四大生成范式各有取舍:GAN 快但难训、VAE 稳但模糊、Diffusion 质量高但慢、Autoregressive 是文本事实标准。
  3. Transformer 通过自注意力实现了并行化和远程依赖建模,成为统一架构。
  4. 大模型的能力主要来自预训练,好用程度主要来自对齐(SFT+RLHF)。
  5. 选模型不看榜单看场景:预算、语言、部署方式、上下文需求都是决策变量。
  6. Prompt / RAG / 微调是三种适配手段,成本和灵活性递增,按需求选择。

中篇预告 ​

中篇《实践、工具链与行业应用》将覆盖:

  • 提示词工程的 10 个高级技巧(含思维链、自洽性、角色设定等)
  • 从 0 到 1 搭建 RAG 系统(向量数据库、Embedding、重排序)
  • Agent 工程实战:工具调用、多 Agent 协作、错误处理
  • AIGC 工具链全景:从创作到生产力的 30+ 工具
  • 行业落地案例:编程、设计、营销、教育、医疗、金融
  • API 开发与成本优化:如何把大模型集成进你的系统
  • 本地部署指南:消费级显卡跑 70B 模型的完整方案

一句话总结上篇:AIGC 不是魔法,是"概率分布建模 + 大规模算力 + 工程优化"的产物。理解了这一点,你就不会被各种花哨的概念和营销话术带偏。

下篇继续:[AIGC 完整入门教程(中):实践、工具链与行业应用]

基于 Vite 强力驱动 | 纯静态轻量托管