CountGD++: 用于开放世界计数的通用提示方法
计算机视觉与模式识别
2025-12-30 v1
摘要
自动计数图像和视频中物体的方法的灵活性和准确性受限于目标物体的指定方式。虽然现有方法允许用户以文本和视觉示例描述目标物体,但视觉示例必须手动标注在图像内部,且无法指定不计数的内容。为此,我们引入新功能,扩展了目标物体可指定的方式。具体而言,我们将提示扩展为可用文本和/或视觉示例描述不计数的内容,引入“伪示例”(pseudo-exemplars)概念以自动生成推断时的视觉示例,并将计数模型扩展以接受来自自然和人造外部图像的视觉示例。我们还将新的计数模型 CountGD++ 作为 LLM 的视觉专家代理。这些贡献扩展了多模态开放世界计数的提示灵活性,显著提高了准确性、效率和跨数据集的泛化能力。代码已公开于 https://github.com/niki-amini-naieni/CountGDPlusPlus。
引用
@article{arxiv.2512.23351,
title = {CountGD++: Generalized Prompting for Open-World Counting},
author = {Niki Amini-Naieni and Andrew Zisserman},
journal= {arXiv preprint arXiv:2512.23351},
year = {2025}
}