中文

任意粒度的计数

计算机视觉与模式识别 2026-05-12 v1

摘要

开放世界目标计数仍显脆弱:尽管视觉-语言模型(VLM)取得了快速进展,但可靠地计数用户意图的对象仍未解决。我们认为核心原因在于计数粒度被留作隐式处理;用户可能指指具体身份、属性、实例类型、类别或抽象概念,而大多数方法将“计数对象”视为单一的、以类别为级别的匹配问题。本文提出将开放世界计数重新定义为多粒度计数,其中视觉示例指定目标外观与细粒度文本,而可选的负面提示则指定意图语义粒度,跨越五个明确的层级。将粒度显式化后暴露出关键数据瓶颈:现有计数数据集缺乏多类别场景、受控干扰项以及实例级标注,无法验证细粒度提示语义。为此,我们提出首个完全自动的数据扩展管道,集成可控 3D 合成、一致图像编辑与 VLM 过滤,构建 KubriCount——目前规模最大、标注最全面的计数数据集,支持训练与多粒度评估。系统化基准测试揭示,无论是多模态大语言模型还是专用计数模型,在细粒度区分下都表现出严重的提示跟随失败。基于此,我们训练 HieraCount——一个多粒度计数模型,联合利用文本与视觉示例作为互补的目标规格。HieraCount 在多粒度计数准确率上显著提升,并在挑战性真实场景中实现稳健泛化。项目页面可在此处访问:https://verg-avesta.github.io/KubriCount/。

关键词

引用

@article{arxiv.2605.10887,
  title  = {Count Anything at Any Granularity},
  author = {Chang Liu and Haoning Wu and Weidi Xie},
  journal= {arXiv preprint arXiv:2605.10887},
  year   = {2026}
}

备注

Project page: https://verg-avesta.github.io/KubriCount/