中文

按点绑定视觉特征

计算机视觉与模式识别 2026-05-26 v1 人工智能

摘要

尽管在标准基准测试上取得成功,视觉语言模型在处理多目标场景时仍表现出持续的失败,包括许多对人类而言相对容易的任务。最近的研究发现,这些失败可能源于模型在上下文中准确绑定对象特征的基本能力不足,这一挑战被称为认知科学和神经科学中的“绑定问题”。人类视觉系统通过串行处理来解决该绑定问题,即逐个注意单个对象,以避免来自其他对象的干扰。最近的研究提出了“指向”——使用显式空间坐标指代对象——作为视觉语言模型的类似解决方案,并发现它可以提高在具有挑战性的多目标任务上的性能。然而,尚不清楚为何(即在机制或表示层面)这种方法能提高性能,以及它如何直接关系到人类视觉中的串行处理。本文中,我们调查了这一问题。我们发现,通过文本学习指向会诱导内部视觉搜索例程,我们对支持这一程序的机制进行了表征。我们还发现,指向行为可以通过微调推广到新任务,且该做法消除了绑定错误并实现了组合泛化。这些结果为证明只要采用串行处理,即可为视觉语言模型解决绑定问题(正如生物视觉中所示)提供了案例。

引用

@article{arxiv.2605.25427,
  title  = {Binding Visual Features Point by Point},
  author = {Udith Haputhanthri and Declan Campbell and Rim Assouel and Jonathan D. Cohen and Taylor W. Webb},
  journal= {arXiv preprint arXiv:2605.25427},
  year   = {2026}
}