当前 AI 模型能否数到我们想要的,而不仅仅是看到的?——基于 PairTally 的基准测试与系统评估
计算机视觉与模式识别
2025-09-18 v1
摘要
视觉计数是基础且具挑战性的任务,尤其当用户需要在复杂场景中计数特定类型的对象时。虽然近期模型,包括类无感知计数模型和大型视觉语言模型(VLM),在计数任务中显示出前景,但其在细粒度、意图驱动型计数方面的能力尚不明确。本文提出 PairTally,一个专为评估细粒度视觉计数而设计的基准数据集。PairTally 包含 681 幅高分辨率图像,每幅图像包含两种对象类别,要求模型在形状、大小、颜色或语义上的细微差异中进行区分和计数。数据集涵盖 inter-category(不同类别)和 intra-category(紧密相关子类别)情景,适用于严格评估选择性计数能力。我们对多种最新模型进行基准测试,包括 exemplar-based 方法、language-prompted 模型和大型 VLM。结果表明,尽管近期进展显著,但当前模型在细粒度和视觉模糊情况下的可靠计数能力仍受限。PairTally 为诊断和改进细粒度视觉计数系统提供了新基础。
引用
@article{arxiv.2509.13939,
title = {Can Current AI Models Count What We Mean, Not What They See? A Benchmark and Systematic Evaluation},
author = {Gia Khanh Nguyen and Yifeng Huang and Minh Hoai},
journal= {arXiv preprint arXiv:2509.13939},
year = {2025}
}