V-MAGE:用于评估多模态大语言模型中视觉中心能力的游戏评估框架
计算机视觉与模式识别
2026-04-27 v3
摘要
近期,多模态大语言模型(MLLM)在视觉文本处理方面展现了令人印象深刻的能力。然而,现有的静态图像文本基准测试不足以评估其动态感知和交互推理能力。我们引入基于游戏的视觉中心多能力度评估(V-MAGE),这是一种新颖的游戏评估框架,旨在系统性地评估 MLLM 在交互式、连续空间环境中的视觉推理能力。V-MAGE 包含五个不同的视频游戏,包含超过 30 个精心构建的评估情景。这些情景设置在自由形式、视觉复杂的环境中,要求模型仅通过视觉输入解释动态游戏状态并做出决策,从而在很大程度上反映人类玩家所处的条件。为确保在不同模型之间进行稳健且可解释的比较,V-MAGE 采用考虑不同难度水平和任务多样性的动态 ELO 排名系统。在对最新 MLLM 进行基准测试并与人类基准进行比较后发现,虽然领先模型在简单任务中接近人类水平,但在需要高级推理和任务编排的复杂情景中性能显著下降。这一持续的性能差距凸显了当前 MLLM 在模拟连续时间环境中执行以视觉为基础的交互式帧级控制能力的根本局限性。通过广泛的分析,我们展示了 V-MAGE 在揭示这些局限性方面的实用性,并为改进 MLLM 在动态交互环境中的视觉和推理能力提供了可操作的见解。代码已公开 available at https://github.com/CSU-JPG/V-MAGE。
引用
@article{arxiv.2504.06148,
title = {V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models},
author = {Xiangxi Zheng and Linjie Li and Zhengyuan Yang and Ping Yu and Alex Jinpeng Wang and Rui Yan and Yuan Yao and Lijuan Wang},
journal= {arXiv preprint arXiv:2504.06148},
year = {2026}
}