类无关计数综述:从基于参考到开放世界文本引导方法的进展
计算机视觉与模式识别
2026-02-10 v4
摘要
视觉目标计数近期已转向类无关计数(CAC),该方法旨在解决对任意类别目标进行计数的挑战,这是实现灵活且可泛化计数系统的关键能力。人类无需先验知识即可轻松识别并计数来自不同类别的目标,与此不同,大多数现有计数方法局限于枚举已知类别的实例,需要大量标注数据集进行训练,且在开放词汇设定下表现不佳。相比之下,CAC 旨在计数训练期间从未见过的类别目标,运行于少样本设定下。在本文中,我们首次对 CAC 方法进行了全面综述。我们提出了一种分类法,根据目标类别如何被指定将 CAC 方法分为三种范式:基于参考的、无参考的以及开放世界文本引导的。基于参考的方法通过依赖样本引导机制实现了 SOTA 性能。无参考方法通过利用图像固有模式消除了对样本的依赖。最后,开放世界文本引导方法使用视觉-语言模型,通过文本提示实现目标类别描述,提供了一种灵活且有前景的解决方案。基于该分类法,我们概述了 30 种 CAC 架构,并报告了它们在黄金标准基准上的性能,讨论了关键优势与局限。具体而言,我们在 FSC-147 数据集上展示了结果,使用黄金标准指标设立了排行榜,并在 CARPK 数据集上评估了泛化能力。最后,我们对标注依赖性与泛化能力等持续存在的挑战进行了批判性讨论,并指出了未来方向。
引用
@article{arxiv.2501.19184,
title = {A Survey on Class-Agnostic Counting: Advancements from Reference-Based to Open-World Text-Guided Approaches},
author = {Luca Ciampi and Ali Azmoudeh and Elif Ecem Akbaba and Erdi Sarıtaş and Ziya Ata Yazıcı and Hazım Kemal Ekenel and Giuseppe Amato and Fabrizio Falchi},
journal= {arXiv preprint arXiv:2501.19184},
year = {2026}
}
备注
Preprint version of an article accepted ad Elsevier's CVIU