教材讲解 第十五章

第十五章 ClipCap(图生文)

CLIP 已经会把图变成向量。GPT-2 已经会写下一字。中间缺一座桥:把 CLIP 的图像嵌入映成 GPT 能当「前几个 token」用的向量。这座桥是一个 MLP。看图说话,推理时甚至不用再喂文本。

  1. 冻结 CLIP,取出图像嵌入。
  2. MLP 把它变成约 10 个 prefix token。
  3. 拼到文本嵌入前面,让 GPT 写标题。
  4. 损失只算文本那一段。图 15.5–15.6。

书 §15 · 图 15.1–15.6 · p.251–264

15.1 工作原理

图 15.1 是「图片标题模型」。图 15.2:CLIP 嵌入的维度和 GPT-2 词嵌入不同,要 MLP 转换形状。图 15.3 是推理:只把图像映成的 prefix 丢进 GPT,自回归吐字。

标准 ClipCap 冻结 CLIP 和生成模型,只训 MLP。若生成模型本身弱,效果堪忧,书上也会微调 GPT。一张图可配多条文本,一对图文就是一条训练样本。

书 §15.1–15.3 · 图 15.1–15.4 · p.251–255

看图说话:下一步吐一个字

教学例句。点流水线看当前停在哪一截,再点吐字。

真正的 prefix 不是汉字,是嵌入空间里的 10 个向量。这里用「图0…图9」占位,好看见「先图后字」。

接下节。训练时标题是有的。损失怎么 mask,和第十章 SFT 是同一手法。

15.2–15.3 只对文本算 NTP

训练目标仍是预测下一个 token,但 prefix 那 10 格不当「字」来监督。图 15.5、15.6:只根据图片的嵌入预测文本 token,看图说话,不再需要把文本当输入条件——推理时尤其如此。

§15.6 点到 Qwen-VL 一类模型:视觉编码器接语言模型解码器,动态分辨率、视频帧。那是这条路的后代,不是本章要实现的代码。

书 §15.2–15.6 · 图 15.5–15.8 · p.252–264

下一章。图生文是「看懂再写字」。反过来「从噪声里长出一张图」,是扩散模型。

合上这一章

  1. 桥。CLIP 向量 → MLP → GPT prefix。
  2. 推理。只喂图像映射,自回归写标题。
  3. 损失。只落在文本 token。

章末自测

讲完了。下面几题核对本讲刚说过的概念。点选立刻看对错;做错也不会锁下一章。

第十六章 扩散模型 · 原书 p.265–296

打开第十六章 回到目录