中文

VERIFY:用于调查多模态推理保真度的视觉解释与推理基准

计算机视觉与模式识别 2025-03-17 v1

摘要

视觉推理是人类认知的核心,使个体能够解释并抽象地理解其环境。尽管近期多模态大语言模型(MLLM)在语言和视觉-语言任务中表现出色,但现有基准主要衡量基于识别的技能,不足以评估真正的视觉推理能力。为弥补这一关键差距,我们引入了 VERIFY,这是一个明确设计用于隔离并严格评估最先进 MLLM 视觉推理能力的基准。VERIFY 迫使模型主要基于视觉信息进行推理,提供最少的文本上下文以减少对领域特定知识和语言偏见的依赖。每个问题均附带人工标注的推理路径,使其成为首个对模型决策过程进行深入评估的基准。此外,我们提出了超越单纯准确率来评估视觉推理保真度的新指标,突出了当前模型推理模式中的关键不平衡。我们对领先 MLLM 的全面基准测试揭示了重大局限性,强调了在感知与推理两方面采取平衡且整体的方法的必要性。如需了解更多预告与测试,请访问我们的项目页面 (https://verify-eqh.pages.dev/)。

关键词

引用

@article{arxiv.2503.11557,
  title  = {VERIFY: A Benchmark of Visual Explanation and Reasoning for Investigating Multimodal Reasoning Fidelity},
  author = {Jing Bi and Junjia Guo and Susan Liang and Guangyu Sun and Luchuan Song and Yunlong Tang and Jinxi He and Jiarui Wu and Ali Vosoughi and Chen Chen and Chenliang Xu},
  journal= {arXiv preprint arXiv:2503.11557},
  year   = {2025}
}