第八章 组相对策略优化(GRPO)
PPO 要一张价值网当 Critic。GRPO 换了个主意:同一起点多采几条轨迹,用组里的平均和标准差当尺子,看谁相对更好。优势不再来自 V(s),而来自「跟哥几个比」。
- 一Group Relative:一组轨迹互相当基线。
- 二不必训练价值网络。省参数、省显存。
- 三一条轨迹上每个动作,先分到同一条组内优势。图 8.1。
- 四更新仍用 PPO 那套 clip,外加可选的 KL(π∥πref)。
书 §8.1–8.2 · p.119–125
8.1 原理:跟组里的平均比
是什么。旧策略 πold 采 G 条轨迹(G 比如 8、10)。每条有一个回报。组内均值 μ、标准差 σ。第 i 条的相对优势:
目标函数式 (8.1) 看起来像 PPO:比值 p = πθ/πold,取 min(p A, clip(p, 1−ε, 1+ε) A),再减 β KL(πθ∥πref)。πref 是冻结的参考模型。
为什么能省 Critic。价值网本来是在问「这个状态平均能拿多少」。一组同起点的轨迹,经验均值就是这个问题的蒙特卡洛答案。比得相对好的往上拧,相对差的往下拧。
书 §8.1 · 式 (8.1) · 图 8.1 · p.119–121
四条轨迹,算组内优势
点一条,看它相对平均是高还是低。拖回报会重算 μ、σ。
σ 接近 0 时(四条几乎一样好),相对优势没意义,更新也接近 0——大家都差不多,不必乱拧。
接下节。书上用 GRPO 玩倒立摆:同一初始状态滚一组回合,比谁撑得久。
8.2 倒立摆上的一组回合
是什么。把「一组轨迹」换成倒立摆:同一套策略,开 G 局。有的 5 步就倒,有的撑到 40 步。撑得久的那局,整条轨迹上的左右推,都分到正优势;倒得快的那局,整条都是负优势。
这当然比逐步 Critic 更粗:一局里某一步其实推得很好,也会被整局分数拖累。换来的是实现简单。第十二章把同一思想用到 LLM:同一道题生成 G 个回答。
书 §8.2 · p.120–125
合上第二部分。从循环、贝尔曼,走到策略梯度、PPO、GRPO。下一章把这些算法接到大语言模型的训练流程上。
合上这一章
- 一组轨迹。均值和标准差当尺子。
- 不训练 V。组内相对就是基线。
- 动作共享轨迹优势。图 8.1。
- clip + 可选 KL 仍在,近端没有丢。
章末自测
讲完了。下面几题核对本讲刚说过的概念。点选立刻看对错;做错也不会锁下一章。