教材讲解 第九章

第九章 大语言模型训练概述

第二部分的倒立摆,到这里换成「写下一句人话」。流程仍分三段:先在海量文本上预训练,再用指令–回答做监督微调,最后用人类偏好做强化学习。PPO、DPO、GRPO 是第三段的三种走法。

  1. 预训练还是第一章的 NTP:看见前面,猜后面。
  2. SFT 换成「按指令回答」。常常只对答案算损失。
  3. RLHF 把人类偏好变成更新信号。
  4. PPO 要奖励模型;DPO 直接吃偏好对;GRPO 一组回答里比相对。

书 §9.1–9.2 · 图 9.1–9.4 · p.127–131

9.1 预训练 → SFT → RLHF

是什么。图 9.1:左边预训练大语言模型,中间 SFT(示例数据集),右边 RLHF(人类反馈数据集),再交给用户。

预训练:数据仍是「abcd」这种文本。希望 π(b|a) π(c|ab) π(d|abc) 尽量大。式 (9.1)。和第一章交叉熵是同一件事。

监督微调:数据变成「指令 + 人工写的回答」。表 9.1 对照:预训练海量、无人工标签;SFT 规模小、有指令格式。实现上经常把提示词那一段的损失 mask 掉,只训练回答(第十章图 10.2)。

书 §9.1.1–9.1.2 · 图 9.1 · 表 9.1 · 式 (9.1) · p.127–128

点一个阶段

看数据从哪来、损失在算什么。

三阶段不是互相替代。后面的阶段站在前面的权重上继续拧。

接下节。第三阶段有三条常用路。点开对比。

9.2 PPO、DPO、GRPO

是什么。图 9.2 把 RLHF 常用算法摆在一起。书后三章各走一条:第十章 DPO,第十一章 PPO 复刻 InstructGPT,第十二章 GRPO / DAPO 复刻 DeepSeek-R1 的味道。

  • PPO:要先训一个奖励模型 RM,再按第五章的 clip 更新策略,并用 KL 拉回 SFT。
  • DPO:跳过 RM。偏好对 (chosen, rejected) 直接变成损失函数。口诀:你的 LLM 实际上是一个奖励模型。
  • GRPO:同一提示采一组回答,组内标准化优势,不必价值网。图 9.3–9.4 就是第八章那条目标。

书 §9.2.1–9.2.3 · 图 9.2–9.4 · p.129–131

三张卡片

点一张,看要不要奖励模型、要不要 Critic、吃什么数据。

PPO

没有绝对最好。有现成偏好对、想少训一个 RM,DPO 省事;要逐步 KL、要对齐得细,PPO 仍常见;要省 Critic、同一题多种答法,GRPO 对路。

下一章。先走最省奖励模型的那条:DPO。

合上这一章

  1. 预训练。NTP,式 (9.1)。
  2. SFT。指令–回答,常只对答案算损失。
  3. RLHF 三路。PPO / DPO / GRPO。

章末自测

讲完了。下面几题核对本讲刚说过的概念。点选立刻看对错;做错也不会锁下一章。

第十章 使用 DPO 微调大语言模型 · 原书 p.133–157

打开第十章 回到目录