中文

你的视觉-语言模型连数到20都数不清:揭露VLM在组合计数中的失效

计算机视觉与模式识别 2025-10-07 v1 人工智能

摘要

视觉-语言模型(VLM)因在大规模网络视觉-语言数据上获得的令人瞩目的能力而成为当今AI社区的焦点。这些模型在 diverse tasks 方面表现突出,包括图像理解、视频理解、复杂视觉推理和具身AI。尽管有这些值得注意的成功,一个根本问题仍悬而未决:VLM能否正确计数?本文引入了一个简单而有效的基准,VLMCountBench,采用极简设置仅使用基本几何形状(如三角形、圆形)及其组合,专注于计数任务,不受其他因素干扰。我们采用严格的独立变量控制,对简单属性如颜色、大小和提示细化进行受控消融实验。我们的实证结果表明,尽管VLM在仅存在单一形状类型时可靠计数,但在多种形状类型组合时(即组合计数) exhibits 显著失效。这凸显了当前VLM的根本实证局限,激发了重要的未来研究方向。

关键词

引用

@article{arxiv.2510.04401,
  title  = {Your Vision-Language Model Can't Even Count to 20: Exposing the Failures of VLMs in Compositional Counting},
  author = {Xuyang Guo and Zekai Huang and Zhenmei Shi and Zhao Song and Jiahao Zhang},
  journal= {arXiv preprint arXiv:2510.04401},
  year   = {2025}
}