大型多模态模型时代的指代表达理解评估回顾
计算机视觉与模式识别
2024-06-25 v1
摘要
指代表达理解(REC)涉及根据文本描述局部目标实例。REC 的 recent 进展由大型多模态模型(LMM)如 CogVLM 等驱动,CogVLM 在 RefCOCO 上取得了 92.44% 的准确率。然而,本研究质疑现有基准如 RefCOCO、RefCOCO+ 和 RefCOCOg 是否捕捉到了 LMM 的全面能力。我们首先对这些基准进行手动检查,发现标注误差率较高:RefCOCO 为 14%,RefCOCO+ 为 24%,RefCOCOg 为 5%,这削弱了评估的真实性。我们通过排除有问题的实例并重新评估能够处理 REC 任务的多个 LMM,显示出显著的准确率提升,从而凸显了基准噪声的影响。作为回应,我们引入 Ref-L4,一个专为评估现代 REC 模型而设计的全面基准。Ref-L4 具有四个关键特征:1)样本规模庞大,包含 45,341 条标注;2)对象类别多样,涵盖 365 种不同类型,实例尺寸范围从 30 到 3,767;3)指代表达平均长度为 24.2 个词;4)词汇量广泛,包含 22,813 个独特词汇。我们在 Ref-L4 上评估了 24 个大型模型,并提供了宝贵的见解。已清理的 RefCOCO、RefCOCO+ 和 RefCOCOg 版本,以及我们的 Ref-L4 基准和评估代码均已在 https://github.com/JierunChen/Ref-L4 上提供。
引用
@article{arxiv.2406.16866,
title = {Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models},
author = {Jierun Chen and Fangyun Wei and Jinjing Zhao and Sizhe Song and Bohuai Wu and Zhuoxuan Peng and S. -H. Gary Chan and Hongyang Zhang},
journal= {arXiv preprint arXiv:2406.16866},
year = {2024}
}