中文

从图像空间到文本空间的线性映射

计算与语言 2023-03-10 v3 机器学习

摘要

纯文本语言模型(language models, LMs)在多大程度上学习到了对非语言世界的特征表示,是一个开放问题。先前工作表明,当优化视觉模型参数以在语言空间中编码图像时,可教会预训练 LMs 为图像生成描述。我们检验一个更强的假设:冻结的纯文本模型与纯视觉模型所学到的概念表示足够相似,以至于仅通过线性映射即可实现上述目标。我们展示,通过仅训练单个线性投影,可将视觉模型的图像表示作为连续提示(continuous prompts)迁移至冻结 LMs。使用这些提示来引导 LM,在图像描述与视觉问答任务上取得了与同时微调图像编码器与文本解码器(如 MAGMA 模型)相竞争的性能。我们比较了预训练期间所见语言监督递增的三种图像编码器:BEIT(无语言信息)、NF-ResNET(词汇类别信息)与 CLIP(完整自然语言描述)。我们发现三者将视觉属性信息(如动物大小)迁移至语言模型的能力相当,但经语言监督预训练的图像编码器更显著地编码类别信息(如区分河马与大象),从而在基准语言-视觉任务上表现明显更优。我们的结果表明,即便仅基于图像训练,LMs 仍以结构上类似于视觉模型的方式编码概念信息。代码见:https://github.com/jmerullo/limber

关键词

引用

@article{arxiv.2209.15162,
  title  = {Linearly Mapping from Image to Text Space},
  author = {Jack Merullo and Louis Castricato and Carsten Eickhoff and Ellie Pavlick},
  journal= {arXiv preprint arXiv:2209.15162},
  year   = {2023}
}

备注

Accepted at ICLR 2023