探寻 grounding IDs:外部线索如何塑造多模态绑定
计算机视觉与模式识别
2026-02-26 v4 人工智能
摘要
大型视觉语言模型(LVLMs)在多模态基准测试中表现出强大的性能,但在结构化推理和精确 grounding 方面仍受限。最近的工作表明,添加简单的视觉结构,如分区和注释,可提高准确度,但其背后的内部机制仍不清晰。我们调查了这一现象,提出了 Grounding IDs 的概念,这些由外部线索诱导的潜在标识符将对象绑定到其指定的分区跨模态。通过表征分析,我们发现这些标识符在嵌入空间中呈现为一致的分区内对齐,并缩小了图像和文本之间的模态间隙。因果干预进一步确认,这些标识符在对象与符号线索之间的绑定中发挥作用。我们表明,Grounding IDs 加强了相关组件之间的注意力,从而改善了跨模态 grounding 并减少了幻觉。综上所述,我们的结果识别出 Grounding IDs 作为解释外部线索如何增强多模态绑定的关键符号机制,并提供了可解释性和实际改进。
引用
@article{arxiv.2509.24072,
title = {Uncovering Grounding IDs: How External Cues Shape Multimodal Binding},
author = {Hosein Hasani and Amirmohammad Izadi and Fatemeh Askari and Mobin Bagherian and Sadegh Mohammadian and Mohammad Izadi and Mahdieh Soleymani Baghshah},
journal= {arXiv preprint arXiv:2509.24072},
year = {2026}
}
备注
Under review as a conference paper at ICLR 2026