通过实例感知联合学习提升广义视觉 grounding
计算机视觉与模式识别
2025-09-18 v1
摘要
广义视觉 grounding 任务包括广义指涉表达式理解(GREC)和指涉表达式分割(GRES),扩展了经典视觉 grounding 框架,以容纳多目标和非目标情景。具体而言,GREC 旨在准确识别所有指涉对象的粗糙边界框,GRES 则旨在实现细粒度的像素级感知。然而,现有方法通常独立处理这些任务,忽略了联合训练 GREC 与 GRES 的潜在益处,以确保多粒度预测的一致性并简化整体流程。此外,当前方法常将 GRES 视为语义分割任务,忽视了实例感知能力的关键作用以及确保实例级边界框与掩码预测一致性的必要性。为此,我们提出了 InstanceVG,一个配备实例感知能力的多任务广义视觉 grounding 框架,利用实例查询统一实例级边界框和掩码的联合一致性预测。据我们所知,InstanceVG 是首个同时处理 GREC 与 GRES 并将实例感知能力纳入广义视觉 grounding 的框架。为实现该框架,我们为每个实例查询分配一个先验参考点,该点也作为目标匹配的额外基准。这一设计促进了对同一实例的点、框和掩码预测的一致性。在十个数据集上的大量实验表明,InstanceVG 在各种评估指标上实现了最先进的性能,显著超越了现有方法。该代码和模型将在 https://github.com/Dmmm1997/InstanceVG 上公开。
引用
@article{arxiv.2509.13747,
title = {Improving Generalized Visual Grounding with Instance-aware Joint Learning},
author = {Ming Dai and Wenxuan Cheng and Jiang-Jiang Liu and Lingfeng Yang and Zhenhua Feng and Wankou Yang and Jingdong Wang},
journal= {arXiv preprint arXiv:2509.13747},
year = {2025}
}
备注
Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) in September 2025