长话短说:解耦对比 VLM 中的组合性与长标题理解
计算机视觉与模式识别
2026-05-13 v2
摘要
对比视觉语言模型(VLMs)在绑定视觉和文本信息方面取得了显著进展,然而理解长而具有组合性的标题仍然是一个开放性挑战。虽然这些能力通常被假定密切相关,但它们相互增强的条件仍不清楚。在本文中,我们实证分析了组合性推理和长标题理解何时能够跨任务迁移,以及这种关系何时会失效。通过对不同的训练目标、数据集和架构设计进行受控实验,我们发现了这两种能力之间存在双向但敏感的关系。在基础不牢的标题上训练的模型或参数更新有限的模型无法泛化,而具有强视觉基础的高质量长标题数据则能同时促进这两种能力。我们进一步表明,旨在保持一般对齐的架构选择(如冻结位置嵌入)可能会无意中限制组合性学习。我们的分析为改善 VLM 泛化的数据选择和模型设计提供了可操作的指南。
引用
@article{arxiv.2509.19207,
title = {Long Story Short: Disentangling Compositionality and Long-Caption Understanding in Contrastive VLMs},
author = {Israfel Salazar and Desmond Elliott and Yova Kementchedjhieva},
journal= {arXiv preprint arXiv:2509.19207},
year = {2026}
}
备注
To be published in Findings of ACL 2026