中文

PropVG:基于多粒度判别的端到端提案驱动视觉定位

计算机视觉与模式识别 2025-09-08 v1 人工智能

摘要

视觉定位的最新进展在很大程度上已从传统的基于提案的两阶段框架转向端到端的直接指代范式,原因是前者效率低下且计算复杂度高。然而,这些方法仅依赖被指代的目标进行监督,忽略了显著候选目标的潜在益处。此外,现有方法通常未能融入多粒度判别,而这对于复杂场景中稳健的目标识别至关重要。为了解决这些局限性,我们提出了 PropVG,一个端到端的基于提案的框架,据我们所知,这是首个无需额外检测器即可将前景目标提案生成与指代目标理解无缝集成的方法。此外,我们引入了一个基于对比学习的指代评分(CRS)模块,该模块在句子和词级别上运用对比学习,以增强理解和区分被指代目标的能力。我们还设计了一个多粒度目标判别(MTD)模块,该模块融合了目标级和语义级信息,以改善对缺失目标的识别。在 gRefCOCO (GREC/GRES)、Ref-ZOM、R-RefCOCO 和 RefCOCO (REC/RES) 基准上的大量实验证明了 PropVG 的有效性。代码和模型已开源,地址为 https://github.com/Dmmm1997/PropVG。

关键词

引用

@article{arxiv.2509.04833,
  title  = {PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination},
  author = {Ming Dai and Wenxuan Cheng and Jiedong Zhuang and Jiang-jiang Liu and Hongshen Zhao and Zhenhua Feng and Wankou Yang},
  journal= {arXiv preprint arXiv:2509.04833},
  year   = {2025}
}

备注

ICCV2025