教材讲解 第八章

第八章 组相对策略优化(GRPO)

PPO 要一张价值网当 Critic。GRPO 换了个主意:同一起点多采几条轨迹,用组里的平均和标准差当尺子,看谁相对更好。优势不再来自 V(s),而来自「跟哥几个比」。

  1. Group Relative:一组轨迹互相当基线。
  2. 不必训练价值网络。省参数、省显存。
  3. 一条轨迹上每个动作,先分到同一条组内优势。图 8.1。
  4. 更新仍用 PPO 那套 clip,外加可选的 KL(π∥πref)。

书 §8.1–8.2 · p.119–125

8.1 原理:跟组里的平均比

是什么。旧策略 πold 采 G 条轨迹(G 比如 8、10)。每条有一个回报。组内均值 μ、标准差 σ。第 i 条的相对优势:

Ai = (ri − μ) / σ 再赋给这条轨迹里的每个动作 A_{τᵢ,t}。图 8.1 · p.121:动作的优势 = 所在轨迹的组内优势。

目标函数式 (8.1) 看起来像 PPO:比值 p = πθold,取 min(p A, clip(p, 1−ε, 1+ε) A),再减 β KL(πθ∥πref)。πref 是冻结的参考模型。

为什么能省 Critic。价值网本来是在问「这个状态平均能拿多少」。一组同起点的轨迹,经验均值就是这个问题的蒙特卡洛答案。比得相对好的往上拧,相对差的往下拧。

书 §8.1 · 式 (8.1) · 图 8.1 · p.119–121

四条轨迹,算组内优势

点一条,看它相对平均是高还是低。拖回报会重算 μ、σ。

σ 接近 0 时(四条几乎一样好),相对优势没意义,更新也接近 0——大家都差不多,不必乱拧。

接下节。书上用 GRPO 玩倒立摆:同一初始状态滚一组回合,比谁撑得久。

8.2 倒立摆上的一组回合

是什么。把「一组轨迹」换成倒立摆:同一套策略,开 G 局。有的 5 步就倒,有的撑到 40 步。撑得久的那局,整条轨迹上的左右推,都分到正优势;倒得快的那局,整条都是负优势。

这当然比逐步 Critic 更粗:一局里某一步其实推得很好,也会被整局分数拖累。换来的是实现简单。第十二章把同一思想用到 LLM:同一道题生成 G 个回答。

书 §8.2 · p.120–125

合上第二部分。从循环、贝尔曼,走到策略梯度、PPO、GRPO。下一章把这些算法接到大语言模型的训练流程上。

合上这一章

  1. 一组轨迹。均值和标准差当尺子。
  2. 不训练 V。组内相对就是基线。
  3. 动作共享轨迹优势。图 8.1。
  4. clip + 可选 KL 仍在,近端没有丢。

章末自测

讲完了。下面几题核对本讲刚说过的概念。点选立刻看对错;做错也不会锁下一章。

第九章 大语言模型训练概述 · 原书 p.127–132 · 预训练 → SFT → RLHF

打开第九章 回到目录