稠密且对齐的图文描述(DAC)促进视觉语言模型的组合推理
计算机视觉与模式识别
2023-06-02 v2
摘要
视觉与语言(VL)模型提供了一种对齐图像与文本表示空间的有效方法,带来了跨模态检索、视觉问答、图像描述等大量应用。然而,所有流行 VL 模型所学到的对齐图像-文本空间仍受所谓“物体偏见”的困扰——其表示表现为“名词袋”,大多忽略或弱化了文本/图像中描述/出现的物体属性、关系与状态。尽管近期文献提出了一些修复这些“组合推理”问题的出色尝试,该问题仍远未解决。本文中,我们揭示了限制 VL 模型组合推理性能的两个因素。这两个因素是用于微调和预训练 VL 模型的配对 VL 数据集的属性:(i)文本的描述质量,或换言之“图像对齐”程度;以及(ii)描述在提及图像中所有细节意义上的“稠密性”。我们提出了一种利用标准 VL 数据集(CC3M)自动处理这些因素的微调方法。应用于 CLIP,我们展示了其组合推理性能相较基础模型提升高达约 27%,相较最强基线提升高达约 20%,平均提升 6.7%。
引用
@article{arxiv.2305.19595,
title = {Dense and Aligned Captions (DAC) Promote Compositional Reasoning in VL Models},
author = {Sivan Doveh and Assaf Arbelle and Sivan Harary and Roei Herzig and Donghyun Kim and Paola Cascante-bonilla and Amit Alfassy and Rameswar Panda and Raja Giryes and Rogerio Feris and Shimon Ullman and Leonid Karlinsky},
journal= {arXiv preprint arXiv:2305.19595},
year = {2023}
}