中文

常规物体置于语境之外(COOCo):探讨参照性沟通中的多模态语境与语义场景违规

计算机视觉与模式识别 2026-02-11 v2 计算与语言

摘要

在生成对物体的参考描述时,视觉语言模型(VLM)在多大程度上依赖场景语境,以及在何种条件下依赖?为回答此问题,我们引入了“常见物体置于语境之外(Common Objects Out-of-Context, COOCo)”数据集,并在不同程度的场景-物体一致性和噪声条件下对几种 VLM 进行实验。我们发现,模型会根据场景-物体语义关联性和噪声水平,对场景语境进行自适应利用。基于这些在模型间一致的趋势,我们进一步探讨 VLM 注意力模式如何随目标-场景语义匹配度变化,以及这些模式在预测分类准确率方面有何贡献。我们发现,成功的物体分类与对目标区域的中层注意力增加相关。我们还发现语义匹配度存在非单调关系,即在中等匹配度时注意力下降,而在低匹配度和高匹配度时注意力反而上升。这些结果表明,VLM 在参考生成过程中会动态地在局部信息和语境信息之间进行权衡。数据集和代码已提供:\href\href{https://github.com/cs-nlp-uu/scenereg}{https://github.com/cs-nlp-uu/scenereg}

关键词

引用

@article{arxiv.2506.22274,
  title  = {Common Objects Out of Context (COOCo): Investigating Multimodal Context and Semantic Scene Violations in Referential Communication},
  author = {Filippo Merlo and Ece Takmaz and Wenkai Chen and Albert Gatt},
  journal= {arXiv preprint arXiv:2506.22274},
  year   = {2026}
}

备注

Accepted to TACL (pre-MIT Press publication version)