中文

VideoGameBench:视觉语言模型能否完成流行视频游戏?

人工智能 2026-05-18 v3 计算与语言 计算机视觉与模式识别

摘要

视觉语言模型(VLM)在编码和数学基准上取得了强大的成绩,这些基准对人类而言具有挑战性。然而,VLM完成一些自然人类完成的任务的能力尚未得到充分研究,例如感知、空间导航和记忆管理。现实视频游戏被设计为利用人类先天归纳偏置,使其易于人类学习和掌握,因而是评估此类能力的理想测试平台。为此,我们引入VideoGameBench,一个包含1990年代10款流行视频游戏的数据集,VLM直接以实时方式与之交互。VideoGameBench挑战模型在仅访问原始视觉输入和目标和控制的高层描述的情况下完成整个游戏,这与现有setup使用特定游戏支架和辅助信息的做法截然不同。我们保留其中三款游戏保密,以鼓励针对未见环境的解决方案。我们的实验显示,前沿视觉语言模型在每款游戏的开始阶段均难以进展。我们发现,推理延迟是前沿模型在实时设置下的主要限制;因此,我们引入VideoGameBench Lite,游戏在等待LM下一个动作时暂停。最佳表现模型——Gemini 2.5 Pro和Claude 3.7 Sonnet——仅分别完成VideoGameBench的0.48%和VideoGameBench Lite的1.6%。我们希望将上述人类技能形式化为此基准能推动这些研究方向的进展。

关键词

引用

@article{arxiv.2505.18134,
  title  = {VideoGameBench: Can Vision-Language Models complete popular video games?},
  author = {Alex L. Zhang and Thomas L. Griffiths and Karthik R. Narasimhan and Ofir Press},
  journal= {arXiv preprint arXiv:2505.18134},
  year   = {2026}
}

备注

10 pages, 38 pages including supplementary