中文

解耦计数目标与观测位置:用于指代表达计数

计算机视觉与模式识别 2025-10-29 v1

摘要

指代表达计数(REC)将类级目标计数扩展到细粒度的子类级,旨在枚举匹配文本表达式所指定的类和区分属性的目标。然而,一个根本性的挑战往往被忽视:标注点通常被放在代表性位置(如头部),迫使模型聚焦于类级特征,同时忽略来自其他视觉区域(如“行走”的腿部)的属性信息。为此,我们提出W2-Net,一种新型框架,通过双查询机制将问题显式解耦为“计数什么”和“在何处观察”。具体而言,除了标准的计数目标(w2c)查询用于局部化目标外,我们引入专门的观察位置(w2s)查询。w2s查询引导寻找和提取来自属性特定视觉区域的特征,从而实现精确的子类判别。此外,我们提出子类可分离匹配(SSM),一种新颖的匹配策略,纳入排斥力以增强子类间的可分性。W2-Net在REC-8K数据集上显著优于最先进的方法,验证集计数误差降低22.5%,测试集降低18.0%,局部分析F1分数分别提升7%和8%。代码将公开提供。

关键词

引用

@article{arxiv.2510.24374,
  title  = {Decoupling What to Count and Where to See for Referring Expression Counting},
  author = {Yuda Zou and Zijian Zhang and Yongchao Xu},
  journal= {arXiv preprint arXiv:2510.24374},
  year   = {2025}
}