中文

BARE:面向偏好感知与推理增强的单塔视觉 grounding 框架

计算机视觉与模式识别 2026-01-06 v1

摘要

视觉 grounding (VG) 旨在定位由表达式指称的特定区域,是多模态理解领域中既关键又具挑战性的任务。虽然最近的 grounding 转移工作通过单塔架构推进了该领域,但仍受两大局限性制约:(1) 过度 entangled 的多模态表征加剧了误导性模态偏置,(2) 足够的语义推理不足以理解指代线索。在本文中,我们提出 BARE,一个面向偏好感知与推理增强的单塔视觉 grounding 框架。BARE 引入一种机制,保留模态特定特征,通过三个新模块构建指代语义:(i) 语言显著性调制器,(ii) 视觉偏置校正与 (iii) 指代关系增强,这三个模块共同减轻多模态干扰并增强指代理解。广泛的实验结果表明,BARE 不仅在五个基准数据集上实现了最先进的性能,还在计算效率方面显著优于现有方法。代码已公开 accessible at https://github.com/Marloweeee/BARE。

关键词

引用

@article{arxiv.2601.01526,
  title  = {BARE: Towards Bias-Aware and Reasoning-Enhanced One-Tower Visual Grounding},
  author = {Hongbing Li and Linhui Xiao and Zihan Zhao and Qi Shen and Yixiang Huang and Bo Xiao and Zhanyu Ma},
  journal= {arXiv preprint arXiv:2601.01526},
  year   = {2026}
}