探索引用表达式计数中的上下文属性密度
计算机视觉与模式识别
2025-03-18 v1
摘要
引用表达式计数(REC)算法旨在实现跨越多种细粒度文本表达的更灵活和交互式计数能力。然而,对细粒度属性理解的要求对现有方法构成挑战,因为它们难以准确地将属性信息与正确的视觉模式对齐。鉴于''视觉密度''已被证明的重要性,人们认为当前REC方法的局限性源于对''上下文属性密度''(CAD)的探索不足。在REC的范围内,我们将CAD定义为某一细粒度属性在视觉区域中的信息强度的度量。为建模CAD,我们提出一个U形CAD估计器,其中引用表达式和来自GroundingDINO的多尺度视觉特征可以相互作用。通过额外的密度监督,我们可以有效编码CAD,随后通过带有CAD细化查询的新型注意力过程进行解码。整合所有这些贡献,我们的框架显著优于最先进的REC方法,在计数指标上实现的误差降低,在定位精度上提升。这些令人惊讶的结果揭示了上下文属性密度对REC的重要性。代码将发布于 github.com/Xu3XiWang/CAD-GD。
引用
@article{arxiv.2503.12460,
title = {Exploring Contextual Attribute Density in Referring Expression Counting},
author = {Zhicheng Wang and Zhiyu Pan and Zhan Peng and Jian Cheng and Liwen Xiao and Wei Jiang and Zhiguo Cao},
journal= {arXiv preprint arXiv:2503.12460},
year = {2025}
}
备注
CVPR25