中文

Ref-Adv: 探索多模态大语言模型在指代表达任务中的视觉推理能力

计算机视觉与模式识别 2026-03-02 v1 人工智能 计算与语言

摘要

指代表达理解将语言与区域级别的视觉感知联系起来。标准基准(RefCOCO、RefCOCO+、RefCOCOg)随着多模态大语言模型的发展取得了快速进展,但仍然是视觉推理和定位的弱测试:(i) 许多表达非常简短,几乎没有推理需求;(ii) 图像通常包含很少的干扰项,使得目标容易找到;(iii) 冗余描述符使得能够绕过真正的文本理解和视觉推理的捷径解决方案。我们引入了Ref-Adv,一个现代的指代表达理解基准,通过将语言上非平凡的表达式与唯一识别目标所必需的信息配对来抑制捷径。该数据集包含真实图像上的指代表达,配有困难的干扰项,并标注了包括否定在内的推理方面。我们进行了全面的消融实验(词序扰动和描述符删除充分性),以表明解决Ref-Adv需要超越简单线索的推理,并评估了一系列当代多模态大语言模型在Ref-Adv上的表现。尽管在RefCOCO、RefCOCO+和RefCOCOg上取得了强劲结果,但模型在Ref-Adv上性能显著下降,揭示了对捷径的依赖以及视觉推理和定位方面的差距。我们提供了深入的失败分析,旨在让Ref-Adv指导未来多模态大语言模型中视觉推理和定位的研究。

关键词

引用

@article{arxiv.2602.23898,
  title  = {Ref-Adv: Exploring MLLM Visual Reasoning in Referring Expression Tasks},
  author = {Qihua Dong and Kuo Yang and Lin Ju and Handong Zhao and Yitian Zhang and Yizhou Wang and Huimin Zeng and Jianglin Lu and Yun Fu},
  journal= {arXiv preprint arXiv:2602.23898},
  year   = {2026}
}

备注

ICLR 2026