GameWorld:面向多模态游戏智能体的标准化与可验证评估
计算机视觉与模式识别
2026-04-10 v1 人工智能
人机交互
摘要
为实现面向现实世界交互的具身通用智能,多模态大语言模型(MLLM)智能体仍面临延迟高、反馈稀疏、错误不可挽回等挑战。视频游戏提供了理想的测试环境,具备丰富的视觉观测和封闭环交互,要求智能体具备细粒度感知、长期规划和精确控制能力。然而,当前由于行动接口异构和验证方法统计,系统性评估这些能力受到阻碍。为此,我们引入GameWorld,一个用于评估MLLM作为通用游戏智能体的基准,支持浏览器环境。研究了两种游戏智能体接口:(i)直接发出键盘和鼠标控制的计算机使用智能体,(ii)通过确定性语义动作解析实现语义动作空间的通用多模态智能体。GameWorld包含34个多样化游戏和170个任务,每个任务均配备状态可验证指标,用于基于结果的评估。18种模型-接口组合的结果表明,即便是表现最佳的智能体,也远未达到人类水平。对基准进行大量重复完整跑测实验,显示该基准具有良好的鲁棒性;进一步研究实时交互、上下文记忆敏感性和动作有效性,揭示了游戏智能体面临的更多挑战。通过提供标准化、可验证且可重复的评估框架,GameWorld为推动多模态游戏智能体及其相关研究奠定了坚实基础。项目页面位于 https://gameworld-bench.github.io。
引用
@article{arxiv.2604.07429,
title = {GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents},
author = {Mingyu Ouyang and Siyuan Hu and Kevin Qinghong Lin and Hwee Tou Ng and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2604.07429},
year = {2026}
}
备注
23 pages, 8 figures