CountGD:多模态开放世界计数
计算机视觉与模式识别
2025-03-12 v2
摘要
本文旨在提高开放词汇目标计数在图像中的通用性和准确性。为提高通用性,我们将开放词汇检测基础模型(GroundingDINO)用于计数任务,并通过引入模块来实现通过视觉示例指定要计数的目标对象。这些新能力——能够通过多模态(文本和示例)指定目标——导致计数准确性的提升。我们做出了三个贡献:首先,我们引入了第一个开放世界计数模型CountGD,其中提示可以由文本描述、视觉示例或两者组合指定;其次,我们表明该模型在多个计数基准测试上的性能显著优于现有的SOTA——使用文本-only时,CountGD与或超过所有之前的文本-only作品相当,使用文本和视觉示例时,我们超越了所有之前的模型;最后,我们对文本和视觉示例提示之间的不同相互作用进行了初步研究,包括相互强化和一个限制另一个的情况。代码和测试模型的应用程序已发布在https://www.robots.ox.ac.uk/~vgg/research/countgd/上。
引用
@article{arxiv.2407.04619,
title = {CountGD: Multi-Modal Open-World Counting},
author = {Niki Amini-Naieni and Tengda Han and Andrew Zisserman},
journal= {arXiv preprint arXiv:2407.04619},
year = {2025}
}
备注
NeurIPS 2024