中文

长话短说:解耦对比 VLM 中的组合性与长标题理解

计算机视觉与模式识别 2026-05-13 v2

摘要

对比视觉语言模型(VLMs)在绑定视觉和文本信息方面取得了显著进展,然而理解长而具有组合性的标题仍然是一个开放性挑战。虽然这些能力通常被假定密切相关,但它们相互增强的条件仍不清楚。在本文中,我们实证分析了组合性推理和长标题理解何时能够跨任务迁移,以及这种关系何时会失效。通过对不同的训练目标、数据集和架构设计进行受控实验,我们发现了这两种能力之间存在双向但敏感的关系。在基础不牢的标题上训练的模型或参数更新有限的模型无法泛化,而具有强视觉基础的高质量长标题数据则能同时促进这两种能力。我们进一步表明,旨在保持一般对齐的架构选择(如冻结位置嵌入)可能会无意中限制组合性学习。我们的分析为改善 VLM 泛化的数据选择和模型设计提供了可操作的指南。

关键词

引用

@article{arxiv.2509.19207,
  title  = {Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs},
  author = {Israfel Salazar and Desmond Elliott and Yova Kementchedjhieva},
  journal= {arXiv preprint arXiv:2509.19207},
  year   = {2026}
}

备注

To be published in Findings of ACL 2026