中文

超越指代表达:情景理解视觉定位

计算机视觉与模式识别 2026-04-03 v1

摘要

现有的视觉定位基准主要评估图像区域与字面指代表达之间的对齐,其中模型往往可以通过匹配突出的命名类别来成功。我们探索了更具挑战性的情景式视觉定位设置,即目标需通过角色、意图和关系上下文推断,而非显式命名。我们引入指代情景理解(Referring Scenario Comprehension, RSC)基准,以此设定为目标。该基准中的查询为段落长度的文本,描述对象角色、用户目标和上下文线索,包括对干扰对象的刻意引用,这些干扰对象往往需要深入理解才能解决。每个实例都附带可解释的难度标签,用于唯一性、杂乱度、大小、重叠和位置,揭示不同的失败模式并支持细粒度分析。RSC包含约3.1万个训练示例、4000个同域测试示例以及3000个跨域测试集(包含未出现的物体类别)。我们进一步提出ScenGround(情景 grounding),一种作为本设定参考的课程推理方法,结合监督预热启动和难度感知强化学习。实验表明,情景式查询暴露了当前模型在标准基准中未显现的系统性失效,课程训练在具有挑战性的子集上提升了性能,并可迁移至标准基准。

关键词

引用

@article{arxiv.2604.02323,
  title  = {Beyond Referring Expressions: Scenario Comprehension Visual Grounding},
  author = {Ruozhen He and Nisarg A. Shah and Qihua Dong and Zilin Xiao and Jaywon Koo and Vicente Ordonez},
  journal= {arXiv preprint arXiv:2604.02323},
  year   = {2026}
}

备注

20 pages, 18 figures, Project Page: https://catherine-r-he.github.io/RSC/