CountEx:通过 Exemplars 和 Exclusion 实现细粒度计数
计算机视觉与模式识别
2026-02-24 v1
摘要
本文提出了 CountEx,一种判别性视觉计数框架,旨在解决现有基于提示的方法的一个关键局限性:无法显式排除视觉上相似的干扰物。虽然当前方法允许用户通过包含提示指定要计数的对象,但在 clutter 场景中常因难以辨认的目标类别而导致歧义和过度计数。CountEx 允许用户通过包括自然语言描述和可选视觉 exemplars 的多模态提示,表达包含和排除意图,指定要计数和要忽略的对象。在 CountEx 的核心是一个 novel Discriminative Query Refinement 模块,该模块通过首先识别共享视觉特征、然后隔离排除特定模式,最后应用选择性抑制来细化计数查询。为了支持细粒度计数方法的系统评估,我们引入 CoCount,一个包含 1,780 个视频和 10,086 个标注帧、覆盖 97 对类别的基准数据集。实验表明,CountEx 在已知和 novel 类别的对象计数中优于最新方法实现了显著提升。数据和代码已提供,地址为 https://github.com/bbvisual/CountEx。
关键词
引用
@article{arxiv.2602.19432,
title = {CountEx: Fine-Grained Counting via Exemplars and Exclusion},
author = {Yifeng Huang and Gia Khanh Nguyen and Minh Hoai},
journal= {arXiv preprint arXiv:2602.19432},
year = {2026}
}