MMR-Life:拼接真实场景以实现多模态多图推理
计算与语言
2026-03-03 v1 人工智能
计算机视觉与模式识别
摘要
尽管多模态大语言模型(MLLM)的推理能力取得显著进展,使其能够解决科学分析和数学推理等更复杂的任务,但其在现实场景中的推理能力仍 largely 未被探索,且缺乏标准化的评估基准。为填补这一空白,我们引入 MMR-Life,一个综合性基准,旨在评估 MLLM 在真实场景中的多模态多图推理能力。MMR-Life 包含 2,646 个多选题,基于 19,108 张主要来自真实世界语境的图像,全面覆盖七类推理类型:归纳推理、类比推理、因果推理、演绎推理、归纳推理、空间推理和时间推理。不同于现有推理基准,MMR-Life 不依赖特定领域专业知识,而是要求模型整合多个图像信息并应用多样化推理能力。对 37 个先进模型的评估凸显了 MMR-Life 的重大挑战。即便是像 GPT-5 这类顶级模型也仅 achieve 58% 的准确率,并在不同推理类型间表现出显著差异。此外,我们分析了现有 MLLM 的推理范式,探讨了思考长度、推理方法和推理类型等因素对其性能的影响。总之,MMR-Life 为评估、分析和改进下一代多模态推理系统奠定了全面的基础。
引用
@article{arxiv.2603.02024,
title = {MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning},
author = {Jiachun Li and Shaoping Huang and Zhuoran Jin and Chenlong Zhang and Pengfei Cao and Yubo Chen and Kang Liu and Jun Zhao},
journal= {arXiv preprint arXiv:2603.02024},
year = {2026}
}
备注
Accepted by ICLR 2026, 78 pages, 60 figures