MixCount 数据集:弥合开放词汇目标计数的数据鸿沟
计算机视觉与模式识别
2026-05-19 v1 机器学习
摘要
目标计数是一项具有十余年专门研究的基础视觉任务,然而 state-of-the-art 模型在混合目标场景中仍然系统性地失败,这种场景在工业检测和产品分拣等实际应用中占主导地位。我们表明,这一鸿沟很大程度上是由现有训练和评估数据的局限性造成的:真实计数数据集的标注成本过高且存在标注噪声,而现有的合成替代方案则缺乏多样性和真实性。我们通过 MixCount 来解决这个问题,这是一个针对混合目标计数设计的数据集和基准,旨在针对当前计数模型的失败模式。为了克服构建和标注此类数据的高成本,我们开发了一条自动生成流水线,可大规模合成图像、细粒度文本描述和像素级完美的计数标注,消除了困扰以往数据集的标注歧义。在 MixCount 上评估 state-of-the-art 计数模型暴露了其在混合目标场景中的严重性能退化。更重要的是,在我们合成的数据上训练这些模型在真实世界基准上取得了显著提升,在 FSC-147 上将 MAE 降低了 20.14%,在 PairTally 上降低了 18.3%。这些结果确立了 MixCount 既是细粒度计数的基准也是训练数据集,并证明了我们这条能够生成有效无限标注数据的流水线有助于解决计数模型中长期存在的瓶颈。
引用
@article{arxiv.2605.18063,
title = {The MixCount Dataset: Bridging the Data Gap for Open-Vocabulary Object Counting},
author = {Corentin Dumery and Niki Amini-Naieni and Shervin Naini and Pascal Fua},
journal= {arXiv preprint arXiv:2605.18063},
year = {2026}
}
备注
Co-first authors. Dataset and project page https://corentindumery.github.io/projects/mixcount.html