教材讲解 第二十章

第二十章 总结

书从「猜下一个字」走到「在环境里拿奖励」,再走到「按人的偏好拧语言模型」,最后把图也接进同一套注意力和扩散。这一章不考试,只把地图摊开,点哪里回哪里。

  1. LLM:NTP、自监督、交叉熵、Decoder-Only。
  2. RL:策略、回报、PPO clip、GRPO 组内相对。
  3. RLHF:SFT 之后,DPO / PPO / GRPO 三条路。
  4. 多模态:ViT 看图,CLIP 对齐,ClipCap 图生文,扩散和 DALL-E2 生图。

书 §20 · p.379

四大部分,点开回看

进度记在这台浏览器里,滚动即算读过。目录右侧会显示「读到」或「读过」。章末有自测,不锁关。

点一部分

三句人话,并链回该部分的第一章。

链接会跳到该部分的入口章。人话先出现在下面。

接下节。书 p.379 对多模态四条的提纲,做成可点列表。

书上的多模态提纲

原书总结按面试口吻写了四条。下面按原意改成讲解,不是问答测验。

书 §20 · p.379

点一条提纲

ViT图切成 patch,加 CLS 和位置,做分类。

NLP / Audio / Vision Transformer 是同一套注意力,换输入。书在 MNIST 上搭过。

CLIP图文两个编码器,配对余弦要高。

能做文搜图:图嵌入进向量库,文本嵌入去近邻检索。

ClipCapCLIP 冻住,MLP 映成约 10 个 token,GPT 写字。

只对文本算下一 token 损失。生成模型太弱时,光训 MLP 不够。

扩散正向一步加噪,反向 U-Net 去噪,生成没见过的图。

需要图、随机时间步、方差计划。U-Net 输入输出分辨率一致。

DALL-E2 是扩散 + CLIP 先验的组装,提纲写在第十九章。

合上这本书

从「君不见黄河」每次只多一个字,到倒立摆左右推,到偏好对和组内相对,到补丁、对比矩阵、噪声里长出加号。积木是重复的:概率、损失、别走太远、用一组样本当尺子。

  1. 猜下一个字,本质是分类。
  2. 策略输出概率;PPO 把更新按在近端;GRPO 用组内相对省掉 Critic。
  3. 对齐人:DPO 直接吃偏好;PPO 吃 RM + 逐步 KL;GRPO/DAPO 吃规则奖励。
  4. 图也是 token。对齐用对比学习,生图用扩散。

章末自测

讲完了。下面几题核对本讲刚说过的概念。点选立刻看对错;做错也不会锁下一章。

没有下一章。回到目录接着翻。

回到目录 再从第一章走一遍