教材讲解 第四章

第四章 策略梯度法

倒立摆里,物理和奖励规则你改不了。唯一能练的,是那张「看见状态就吐出左右概率」的网。这一章沿这条路走:原始策略梯度、REINFORCE、减去基线、演员–评论家、最后 GAE。

  1. 能控的只有策略。环境和奖励函数都不归你。
  2. 策略输出的是概率。按概率采样动作,才会探索。
  3. REINFORCE:评估这一步,只用这一步之后的回报 Gt,别把过去的分算进来。
  4. 减去基线,方差更小。杆已经注定要倒时,权重变成 0,别瞎强化。
  5. GAE 用 λ 在「只看下一步」和「看完全程」之间滑动。

书 §4.1–4.8 · p.61–90

4.1 原始策略梯度:只能拧策略

是什么。表 4.1 画得很清楚:策略函数能控,环境不能控,奖励函数不能控。通行做法是:策略 = 神经网络。输入状态(四个浮点数),输出每个动作一个分数,当成概率。两个动作就两个神经元,例如向左 0.7、向右 0.3。图 4.1。

目标:让轨迹回报的期望 J(θ) = Eτ∼πθ[G(τ)] 尽量大。梯度上升:θ ← θ + α ∇J。直觉是:这条轨迹总分高,就把「当时那些动作」的概率调高;总分低,就调低。

书 §4.1.1 · 表 4.1 · 图 4.1 · p.61–64

策略输出的是概率

拖「向左」的概率,再点采样。骰子会按这个分布抽。

0.70
还没抽。

概率不是命令。0.7 向左,十次里大约七次向左,三次向右。训练要的就是把「高回报那种抽法」变得更常见。

接下节。原始公式里,每一步都乘整条轨迹的 G(τ)。过去的分会变成噪声。REINFORCE 把它改掉。

4.2 REINFORCE:只用这一步之后的分

是什么。原始策略梯度里,无论时刻 t,权重都是整条轨迹的 G(τ)。可是评估动作 At 好不好,t 之前拿到的奖励与它无关。那些分是噪声。

改法:用从 t 起的回报 Gt = Rt + γ Rt+1 + ⋯ 当权重。名字 REINFORCE 是一长串英文的缩写,记住算法即可。

∇J(θ) = E [ Σt Gt ∇ log πθ(At | St) ] 对照式 (4.23) 改用 Gt。书 §4.2.1 · p.73

书 §4.2.1 · p.73–74

一条短轨迹:G(τ) vs Gt

四拍奖励 1, 1, 0, 2。点下一步,看「整条总分」和「从这一拍往后」差在哪。

第一步之前已经发生的分,不该决定「要不要强化这一步」。REINFORCE 把镜头对准以后。

接下节。Gt 仍可能总是正的——杆撑三步就倒,三个动作都会被加上 +3。该减一个基线。

4.3 基线:减去「本来就值这些」

是什么。把权重改成 Gt − b(St)。b 可以是任意只依赖状态的函数。实践中常用价值函数 V(s)。式 (4.50)。

为什么。图 4.12:杆已经歪到无论怎么推,三步后必倒。G = 3。没有基线时,这两个无用动作都会被 +3 强化。若 V(s) 已经知道「这里只值 3」,权重变成 0,概率不升也不降。

书 §4.3 · 定理 4.3 · 图 4.12 · p.77–78

注定要倒的三步

开关基线。G = 3,V = 3 时权重清零。

权重 = G = 3

3

基线不改期望(证明在 §4.7.2),只改方差。样本更省。

接下节。价值函数自己也是一张网。一张演戏,一张打分:演员–评论家。

4.4 Actor-Critic

是什么。Actor(演员)是策略网,出动作。Critic(评论家)是价值网,估 V(s)。带基线的 REINFORCE 里如果用 V 当基线,就已经像这对搭档。图 4.13。

Critic 不必等回合结束才给分,可以用一拍的 TD 误差:δt = Rt + γ V(st+1) − V(st)。这就是「优势」的一种。图 4.14 对比蒙特卡洛(等终局)和 TD(走一步就评)。

书 §4.4 · 图 4.13–4.14 · p.78–80

接下节。一步 TD 太短视,蒙特卡洛方差又大。GAE 用 λ 把多步掺在一起。

4.6 广义优势估计 GAE

是什么。一步 TD:δt = Rt + γ V(st+1) − V(st)。多步可以把后面的 δ 接上。GAE 对 1 步、2 步、3 步……做指数加权平均。λ = 0 只留一步 TD;λ = 1 接近把全程回报减 V。

AGAEt = δt + (γλ) δt+1 + (γλ)2 δt+2 + ⋯ 式 (4.58)–(4.60) · p.85。λ 在偏差和方差之间拧。

书 §4.5–4.6 · p.84–86

拖 λ:从一步看到全程

示意三条 δ = 1, 0.5, −0.2。λ 越大,后面的 δ 掺得越多。

0.95

A0GAE(γ=0.99)

PPO 实战里会用这段 GAE。先记住旋钮:λ 小 = 相信价值网、看近处;λ 大 = 更信实际回报、看远处。

合上。策略梯度会拧,但步子太大策略会崩。下一章 PPO 用裁剪把更新按在近处。

合上这一章

  1. 只能拧策略。输出是概率,按概率采样。
  2. REINFORCE。权重用 Gt,不要整条 G(τ)。
  3. 基线。Gt − V(s)。注定要倒时权重为 0。
  4. Actor-Critic。策略演戏,价值打分。
  5. GAE。λ 从一步 TD 滑到蒙特卡洛。

章末自测

讲完了。下面几题核对本讲刚说过的概念。点选立刻看对错;做错也不会锁下一章。

第五章 近端策略优化(PPO) · 原书 p.91–98

打开第五章 回到目录