OmniCount:基于语义 - 几何先验的多标签物体计数
计算机视觉与模式识别
2025-10-01 v9 图像与视频处理
信号处理
摘要
物体计数对于理解场景构成至关重要。此前,该任务主要由特定类别的方法主导,这些方法已逐渐演变为适应性更强的类别无关策略。然而,这些策略也有其自身的局限性,例如需要手动输入示例以及对多个类别进行多次传递,导致效率显著低下。本文介绍了一种更实用的方法,能够利用开放词汇框架同时计数多个物体类别。我们的解决方案 OmniCount 脱颖而出,它利用预训练模型中的语义和几何洞察(先验)来计数用户指定的多个类别的物体,且无需额外训练。OmniCount 的独特之处在于生成精确的物体掩码,并通过 Segment Anything Model 利用各种交互式提示进行高效计数。为了评估 OmniCount,我们创建了 OmniCount-191 基准,这是一个首创的多标签物体计数数据集,包含点、边界框和 VQA 标注。我们在 OmniCount-191 以及其他领先基准上的综合评估表明,OmniCount 的性能卓越,显著优于现有解决方案。项目网页地址为 https://mondalanindya.github.io/OmniCount。
引用
@article{arxiv.2403.05435,
title = {OmniCount: Multi-label Object Counting with Semantic-Geometric Priors},
author = {Anindya Mondal and Sauradip Nag and Xiatian Zhu and Anjan Dutta},
journal= {arXiv preprint arXiv:2403.05435},
year = {2025}
}
备注
Accepted to AAAI 2025