视觉语言模型能否计数?注意力机制干预的合成基准与分析
计算机视觉与模式识别
2026-04-06 v3
摘要
近期研究表明,视觉语言模型(VLMs)在回答关于图像视觉属性的问题时,常常依赖于训练期间学习到的内在偏差。当VLMs被询问需要选择性视觉注意力的特定问题时,这些偏差会被放大,这种需求镜像了人类枚举任务中观察到的认知挑战。我们基于此研究,构建合成基准数据集和评估框架,系统化刻画计数绩效随图像和提示属性变化的规律。利用开源VLMs,我们分析了在受控扰动(如对象数量、对象颜色、背景颜色、对象纹理、背景纹理及提示特异性)下的绩效变化,以及相应的视觉注意力分配变化。我们进一步对语言模型解码器中的注意力重加权进行探索性实验,以调制不同层级视觉标记的注意力,评估其对计数行为的影响。我们的结果揭示了计数准确率随视觉和语言复杂度增加而系统性下降,这呼应了人类感知中的认知负荷效应;同时,针对性注意力重加权虽仅带来有限的改进,却显著可测。我们不主张基准准确率的竞争,而是引入受控诊断框架以分析VLM的枚举行为。通过系统实验,我们暴露了根植于跨模态绑定的失效模式,这些失效模式可能难以在自然图像基准中轻易隔离,并提供初步实证证据表明,针对性注意力重加权可影响模型如何在视觉表征中为语言数量概念提供 grounding。代码与数据已公开:https://github.com/ssen7/vlm-count-analysis
引用
@article{arxiv.2511.17722,
title = {Can Vision-Language Models Count? A Synthetic Benchmark and Analysis of Attention-Based Interventions},
author = {Saurav Sengupta and Nazanin Moradinasab and Jiebei Liu and Donald E. Brown},
journal= {arXiv preprint arXiv:2511.17722},
year = {2026}
}
备注
Accepted at COGVL Workshop at CVPR 2026