常规物体置于语境之外(COOCo):探讨参照性沟通中的多模态语境与语义场景违规
计算机视觉与模式识别
2026-02-11 v2 计算与语言
摘要
在生成对物体的参考描述时,视觉语言模型(VLM)在多大程度上依赖场景语境,以及在何种条件下依赖?为回答此问题,我们引入了“常见物体置于语境之外(Common Objects Out-of-Context, COOCo)”数据集,并在不同程度的场景-物体一致性和噪声条件下对几种 VLM 进行实验。我们发现,模型会根据场景-物体语义关联性和噪声水平,对场景语境进行自适应利用。基于这些在模型间一致的趋势,我们进一步探讨 VLM 注意力模式如何随目标-场景语义匹配度变化,以及这些模式在预测分类准确率方面有何贡献。我们发现,成功的物体分类与对目标区域的中层注意力增加相关。我们还发现语义匹配度存在非单调关系,即在中等匹配度时注意力下降,而在低匹配度和高匹配度时注意力反而上升。这些结果表明,VLM 在参考生成过程中会动态地在局部信息和语境信息之间进行权衡。数据集和代码已提供:。
引用
@article{arxiv.2506.22274,
title = {Common Objects Out of Context (COOCo): Investigating Multimodal Context and Semantic Scene Violations in Referential Communication},
author = {Filippo Merlo and Ece Takmaz and Wenkai Chen and Albert Gatt},
journal= {arXiv preprint arXiv:2506.22274},
year = {2026}
}
备注
Accepted to TACL (pre-MIT Press publication version)