评估专用计数架构与视觉语言模型的视觉枚举能力
计算机视觉与模式识别
2025-12-18 v1 机器学习
摘要
数数视觉场景中的物品数量是计算机视觉中的一个基本且具挑战性的任务。传统方法依赖于使用带有预定义对象类别注释的数据集训练的领域特定计数架构。然而,近期在创建大规模多模态视觉语言模型(VLMs)方面的进展表明,这些领域通用的架构可能为开放集对象计数提供一种灵活的替代方案。因此,本研究系统比较了最先进的专用计数架构与 VLMs 在两个流行计数数据集上的性能,以及在一个专为控制测试图像视觉属性而创建的新型基准数据集上的性能。我们的发现表明,大多数 VLMs 能够大致枚举视觉场景中物品的数量,甚至可以超过专用的计算机视觉架构。值得注意的是,当 VLMs 提示生成每个待计数对象的中间表示(即位置和 verbal 标签)时,枚举准确率会显著提高。然而,None 的模型能够可靠地计数复杂视觉场景中对象的数量,表明仍需进一步研究以创建能够在真实环境中可靠部署计数程序的 AI 系统。
引用
@article{arxiv.2512.15254,
title = {Assessing the Visual Enumeration Abilities of Specialized Counting Architectures and Vision-Language Models},
author = {Kuinan Hou and Jing Mi and Marco Zorzi and Lamberto Ballan and Alberto Testolin},
journal= {arXiv preprint arXiv:2512.15254},
year = {2025}
}