通过丰富提示扩展零样本目标计数
计算机视觉与模式识别
2025-05-27 v2
摘要
扩展预训练的零样本计数模型以处理未见类别的能力,仅仅添加新的提示是不够的,因为这种方法无法实现文本与视觉特征之间的必要对齐,以实现准确计数。我们引入 RichCount,这是第一个解决这些限制的方法,采用两阶段训练策略来增强文本编码并强化模型与图像中对象的关联。RichCount 通过两个关键目标提高了对未见类别的零样本计数能力:(1)通过在文本-图像相似性上训练的前馈网络和适配器丰富文本特征,从而创建稳健、对齐的表示;(2)将此细化的编码器应用于计数任务,使其能够在多样化的提示和复杂图像上实现有效的跨域泛化。通过这种方式,RichCount 超越了简单的提示扩展,建立了 meaningful 的特征对齐,支持跨新类别的准确计数。在三个基准数据集上的大量实验表明,RichCount 的有效性,实现了零样本计数的国际前沿性能,显著提升了在开放世界场景中对未见类别的泛化能力。
引用
@article{arxiv.2505.15398,
title = {Expanding Zero-Shot Object Counting with Rich Prompts},
author = {Huilin Zhu and Senyao Li and Jingling Yuan and Zhengwei Yang and Yu Guo and Wenxuan Liu and Xian Zhong and Shengfeng He},
journal= {arXiv preprint arXiv:2505.15398},
year = {2025}
}