视觉符号机制:视觉语言模型中符号处理的涌现现象
计算机视觉与模式识别
2025-12-16 v2
摘要
要准确地处理视觉场景,观察者必须将特征绑定在一起以表示单个物体。例如,区分包含红色正方形和蓝色圆形的图像与包含蓝色正方形和红色圆形的图像。最近的研究发现,语言模型通过一组类似符号的内容独立索引来解决这一'绑定问题',但尚不清楚视觉语言模型 (VLM) 是否采用类似机制。这一问题尤为重要,由于 VLM 在需要绑定的任务中仍然表现不佳。本文通过 content-independent 的空间索引方案,识别了支撑 VLM 特定绑定的前所未有的涌现符号机制。此外,我们发现当绑定错误发生时,可以直接追溯到这些机制的失效。综上,这些结果阐明了支撑 VLM 中符号类处理机制的方式,并为减少这些模型所表现的绑定错误数目提供了可能的思路。
引用
@article{arxiv.2506.15871,
title = {Visual symbolic mechanisms: Emergent symbol processing in vision language models},
author = {Rim Assouel and Declan Campbell and Yoshua Bengio and Taylor Webb},
journal= {arXiv preprint arXiv:2506.15871},
year = {2025}
}