从绑定问题视角理解视觉语言模型的局限性
人工智能
2025-04-18 v2 计算机视觉与模式识别
机器学习
神经元与认知
摘要
近期研究记录了最先进的视觉语言模型(VLM),包括多模态语言模型和文本到图像模型,在性能上存在显著异质性。这些模型能够描述和生成多样化的复杂自然图像,但在诸如计数、定位和简单视觉类比等基本多物体推理任务上却表现出令人惊讶的失败,而人类在这些任务上几乎能达到完美准确度。为了更好地理解这种令人费解的成功与失败模式,我们转向认知科学和神经科学中关于绑定问题的理论阐述。绑定问题是一个根本性问题,当一组共享的表征资源必须用于表示不同的实体(例如,表示图像中的多个物体)时,就需要使用串行处理来避免干扰。我们发现,最先进VLM的许多令人费解的失败可以解释为由绑定问题引起,并且这些失败模式与人类大脑中快速、前馈处理的局限性惊人地相似。
引用
@article{arxiv.2411.00238,
title = {Understanding the Limits of Vision Language Models Through the Lens of the Binding Problem},
author = {Declan Campbell and Sunayana Rane and Tyler Giallanza and Nicolò De Sabbata and Kia Ghods and Amogh Joshi and Alexander Ku and Steven M. Frankland and Thomas L. Griffiths and Jonathan D. Cohen and Taylor W. Webb},
journal= {arXiv preprint arXiv:2411.00238},
year = {2025}
}