中文

MC-Bench:面向大型多模态语言模型时代的多情境视觉 grounding 基准

计算机视觉与模式识别 2025-07-23 v2

摘要

虽然多模态大语言模型(MLLMs)在视觉语言理解方面展现了惊人的能力,但其解决超越单个图像的实例级视觉语言问题的能力仍需进一步探索。为评估这些未被证实的 MLLM 能力,本文提出了一种新的视觉 grounding 任务,称为多情境视觉 grounding,该任务旨在基于开放式文本提示在多个图像中定位感兴趣的实例。为促进这项研究,我们构建了一个新的数据集 MC-Bench,包含 2000 份高质量且人工标注的样本。每个样本由一个带有实例级标注的图像对和一个指示目标实例的相应文本提示组成。这些文本提示高度开放,遵循三种不同的风格,覆盖 20 项实际技能。我们对超过 20 项最先进的 MLLM 和具有潜在多情境视觉 grounding 能力的基础模型进行基准测试,同时我们开发了一个简单而有效的智能体基线和一个通过多情境指令调优获得的微调基线。我们的评估揭示了现有 MLLM 与人类之间存在显著的性能差距,并提出了一些具有启发性的观察结果,表明未来研究的潜在方向。我们希望 MC-Bench 及我们的实证发现能够鼓励研究社区进一步发展 MLLM 在实例级任务中未被充分利用的潜力,特别是在多图像上下文中。项目页面:https://xuyunqiu.github.io/MC-Bench。

关键词

引用

@article{arxiv.2410.12332,
  title  = {MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs},
  author = {Yunqiu Xu and Linchao Zhu and Yi Yang},
  journal= {arXiv preprint arXiv:2410.12332},
  year   = {2025}
}

备注

Accepted by ICCV 2025