第九章 大语言模型训练概述
第二部分的倒立摆,到这里换成「写下一句人话」。流程仍分三段:先在海量文本上预训练,再用指令–回答做监督微调,最后用人类偏好做强化学习。PPO、DPO、GRPO 是第三段的三种走法。
- 一预训练还是第一章的 NTP:看见前面,猜后面。
- 二SFT 换成「按指令回答」。常常只对答案算损失。
- 三RLHF 把人类偏好变成更新信号。
- 四PPO 要奖励模型;DPO 直接吃偏好对;GRPO 一组回答里比相对。
书 §9.1–9.2 · 图 9.1–9.4 · p.127–131
9.1 预训练 → SFT → RLHF
是什么。图 9.1:左边预训练大语言模型,中间 SFT(示例数据集),右边 RLHF(人类反馈数据集),再交给用户。
预训练:数据仍是「abcd」这种文本。希望 π(b|a) π(c|ab) π(d|abc) 尽量大。式 (9.1)。和第一章交叉熵是同一件事。
监督微调:数据变成「指令 + 人工写的回答」。表 9.1 对照:预训练海量、无人工标签;SFT 规模小、有指令格式。实现上经常把提示词那一段的损失 mask 掉,只训练回答(第十章图 10.2)。
书 §9.1.1–9.1.2 · 图 9.1 · 表 9.1 · 式 (9.1) · p.127–128
点一个阶段
看数据从哪来、损失在算什么。
三阶段不是互相替代。后面的阶段站在前面的权重上继续拧。
接下节。第三阶段有三条常用路。点开对比。
9.2 PPO、DPO、GRPO
是什么。图 9.2 把 RLHF 常用算法摆在一起。书后三章各走一条:第十章 DPO,第十一章 PPO 复刻 InstructGPT,第十二章 GRPO / DAPO 复刻 DeepSeek-R1 的味道。
- PPO:要先训一个奖励模型 RM,再按第五章的 clip 更新策略,并用 KL 拉回 SFT。
- DPO:跳过 RM。偏好对 (chosen, rejected) 直接变成损失函数。口诀:你的 LLM 实际上是一个奖励模型。
- GRPO:同一提示采一组回答,组内标准化优势,不必价值网。图 9.3–9.4 就是第八章那条目标。
书 §9.2.1–9.2.3 · 图 9.2–9.4 · p.129–131
三张卡片
点一张,看要不要奖励模型、要不要 Critic、吃什么数据。
| 项 | PPO |
|---|
没有绝对最好。有现成偏好对、想少训一个 RM,DPO 省事;要逐步 KL、要对齐得细,PPO 仍常见;要省 Critic、同一题多种答法,GRPO 对路。
下一章。先走最省奖励模型的那条:DPO。
合上这一章
- 预训练。NTP,式 (9.1)。
- SFT。指令–回答,常只对答案算损失。
- RLHF 三路。PPO / DPO / GRPO。
章末自测
讲完了。下面几题核对本讲刚说过的概念。点选立刻看对错;做错也不会锁下一章。