第二十章 总结
书从「猜下一个字」走到「在环境里拿奖励」,再走到「按人的偏好拧语言模型」,最后把图也接进同一套注意力和扩散。这一章不考试,只把地图摊开,点哪里回哪里。
- 一LLM:NTP、自监督、交叉熵、Decoder-Only。
- 二RL:策略、回报、PPO clip、GRPO 组内相对。
- 三RLHF:SFT 之后,DPO / PPO / GRPO 三条路。
- 四多模态:ViT 看图,CLIP 对齐,ClipCap 图生文,扩散和 DALL-E2 生图。
书 §20 · p.379
四大部分,点开回看
进度记在这台浏览器里,滚动即算读过。目录右侧会显示「读到」或「读过」。章末有自测,不锁关。
接下节。书 p.379 对多模态四条的提纲,做成可点列表。
书上的多模态提纲
原书总结按面试口吻写了四条。下面按原意改成讲解,不是问答测验。
书 §20 · p.379
点一条提纲
ViT图切成 patch,加 CLS 和位置,做分类。
NLP / Audio / Vision Transformer 是同一套注意力,换输入。书在 MNIST 上搭过。
CLIP图文两个编码器,配对余弦要高。
能做文搜图:图嵌入进向量库,文本嵌入去近邻检索。
ClipCapCLIP 冻住,MLP 映成约 10 个 token,GPT 写字。
只对文本算下一 token 损失。生成模型太弱时,光训 MLP 不够。
扩散正向一步加噪,反向 U-Net 去噪,生成没见过的图。
需要图、随机时间步、方差计划。U-Net 输入输出分辨率一致。
DALL-E2 是扩散 + CLIP 先验的组装,提纲写在第十九章。
合上这本书
从「君不见黄河」每次只多一个字,到倒立摆左右推,到偏好对和组内相对,到补丁、对比矩阵、噪声里长出加号。积木是重复的:概率、损失、别走太远、用一组样本当尺子。
- 猜下一个字,本质是分类。
- 策略输出概率;PPO 把更新按在近端;GRPO 用组内相对省掉 Critic。
- 对齐人:DPO 直接吃偏好;PPO 吃 RM + 逐步 KL;GRPO/DAPO 吃规则奖励。
- 图也是 token。对齐用对比学习,生图用扩散。
章末自测
讲完了。下面几题核对本讲刚说过的概念。点选立刻看对错;做错也不会锁下一章。