视觉-语言模型在“看”场景时看到了什么
计算与语言
2021-09-16 v1
摘要
图像既可以根据其所包含的对象来描述,也可以根据其实例化出的场景或场所类型来描述。在本文中,我们探讨预训练的视觉与语言(V&L)模型能在多大程度上学习将这两类描述与图像对齐。我们比较了 3 个当前最优(state-of-the-art)模型:VisualBERT、LXMERT 和 CLIP。我们发现:(i)V&L 模型易受预训练期间获得的风格偏见影响;(ii)只有 CLIP 在对象级和场景级描述上均表现稳定良好。后续消融研究表明,CLIP 利用视觉模态中的对象级信息来与场景级文本描述对齐。
引用
@article{arxiv.2109.07301,
title = {What Vision-Language Models `See' when they See Scenes},
author = {Michele Cafagna and Kees van Deemter and Albert Gatt},
journal= {arXiv preprint arXiv:2109.07301},
year = {2021}
}