UGround:面向统一视觉 grounding 的无缝变换器
计算机视觉与模式识别
2026-05-13 v4
摘要
我们提出了 UGround,这是第一个统一视觉 grounding 的范式,通过动态选择跨越无缝变换器的中间层作为“掩码作为提示”,这与当前主流管道利用固定最后隐藏层作为“<SEG> 作为提示”的做法不同。UGround 解决了当前范式提出的两个主要挑战:(1) 其对固定最后隐藏层的依赖,这会依次放大由层间传播产生的累积误差,同时缺乏中间纠正;(2) 其使用 <SEG> 作为提示,这会在没有显式空间线索(如坐标)的情况下,将文本嵌入隐式地投射到视觉空间。UGround 的核心是策略导向的掩码提示(Policy-Prompted Masking),其中包含两个关键组件:随机跳过连接(Stochastic Skip Connection, SSC)和掩码作为提示(Mask as Prompt, MasP)。SSC 是一种强化学习策略,通过随机抽样,使每个 <SEG> token 横跨无缝变换器的层,实现在连接到视觉模型(如 SAM)时的动态层选择。给定一个所选隐藏层,MasP 使用来自 <SEG> token 与图像 token 的相似度图作为软逻辑掩码,提示 SAM 生成掩码,通过其激活区域提供显式空间线索。为验证 UGround 的有效性,我们首次从属性角度在单一框架内统一视觉 grounding,涵盖从传统指代表达分割到新提出的推理分割,从单目标到多目标,从正查询到虚假前提(空目标)。所有代码和模型均公开于 https://github.com/rui-qian/UGround。
引用
@article{arxiv.2510.03853,
title = {UGround: Towards Unified Visual Grounding with Unrolled Transformers},
author = {Rui Qian and Xin Yin and Chuanhang Deng and Zhiyuan Peng and Jian Xiong and Wei Zhai and Dejing Dou},
journal= {arXiv preprint arXiv:2510.03853},
year = {2026}
}
备注
This work has been accepted to ICML 2026, please refer to https://github.com/rui-qian/UGround