面向开放世界的指代表达理解:基于无训练多任务一致性检查器的基准
计算机视觉与模式识别
2026-05-26 v1
摘要
指代表达理解(REC)旨在基于给定表达式在图像中局部化目标对象。尽管最近的视觉语言模型在 REC 任务上取得了显著进展,但当前的 REC 基准往往只涉及简单场景,且假设每个表达式对应唯一目标。这些限制阻碍了 REC 模型在开放世界环境中的部署。为填补这一空白,我们引入 OpenRef,一个用于复杂视觉和语言场景下 REC 的新基准。OpenRef 具有三个关键突破:1) 多样化视觉场景:涵盖地面视角、无人机视角、暗色场景和恶劣天气条件等多样化视觉领域;2) 可变目标数量:突破单目标限制,包含多目标和无目标样本;3) 丰富词汇类型:纳入专有名词、多义词和序数词,以适应更广泛的表达需求。此外,由于传统指标在开放世界设置下不足以衡量,我们采用 F1 指标衡量定位准确性,并提出 N3R(Negative Relative Rejection Reliability)来评估对负面表达式的相对拒绝可靠性。最后,我们引入多任务一致性检查器(MCC),一种无需训练即可即插即用的方法,通过强制一致性自我验证来提升模型性能。大量实验表明,本工作在复杂场景下显著提升了现有 REC 模型的性能,为开放世界 REC 铺平了道路。项目页面: https://zongjianwu.github.io/openref
引用
@article{arxiv.2605.25706,
title = {Towards Open-World Referring Expression Comprehension: A Benchmark with Training-free Multi-task Consistency Checker},
author = {Zongjian Wu and Lei Zhang},
journal= {arXiv preprint arXiv:2605.25706},
year = {2026}
}
备注
17 pages, 7 figures. Project Page: https://zongjianwu.github.io/openref