KnowDR-REC:面向现实知识的指代表达理解基准
机器学习
2025-08-21 v1
摘要
指代表达理解(REC)是热门的多模态任务,旨在基于给定文本表达式准确检测单张图像中的目标对象。然而,由于早期模型的局限,传统REC基准要么仅依赖图像内线索,要么缺乏足够细粒度的实例标注,导致不足以评估多模态大语言模型(MLLM)的推理能力。为填补这一空白,我们提出新基准KnowDR-REC,其具有三个关键特征:首先,基于现实知识构建,要求跨文本和图像的细粒度多模态推理;其次,数据集包含通过细粒度表达式编辑构建的精心设计负样本,用于评估模型的鲁棒性和抗幻觉能力;最后,我们引入三个新评估指标,以系统性地探索模型内部推理过程。我们在KnowDR-REC上评估了16个前沿多模态模型,实验结果表明,现有MLLM在知识驱动的视觉定位任务中仍表现不足。此外,我们观察到文本理解与视觉定位之间存在脱节,许多模型被记忆的捷径关联显著影响,这严重影响其在本基准上的表现并阻碍真正的多模态推理。我们预期,所提出的基准将激励未来研究,致力于开发更加鲁棒、可解释且知识密集型的视觉定位框架,推动开发可靠且鲁棒的多模态系统以应对复杂现实场景。
引用
@article{arxiv.2508.14080,
title = {KnowDR-REC: A Benchmark for Referring Expression Comprehension with Real-World Knowledge},
author = {Guanghao Jin and Jingpei Wu and Tianpei Guo and Yiyi Niu and Weidong Zhou and Guoyang Liu},
journal= {arXiv preprint arXiv:2508.14080},
year = {2025}
}