中文

GameVerse:基于视频反思的视觉语言模型能否学习

计算机视觉与模式识别 2026-03-11 v2 人工智能

摘要

人类游戏是一种以视觉为导向的交互循环,玩家会行动、反思失败并观看教程以细化策略。视觉语言模型(VLMs)是否也能从视频反思中学习?我们提出 GameVerse,一个综合性的视频游戏基准测试,旨在实现反思性的视觉交互循环。本研究超越了传统的即时发射评估,提出一种反思-重试范式,以衡量 VLMs 如何内化视觉经验并改进策略。为实现系统且可扩展的评估,我们还引入了一个覆盖 15 个全球热门游戏的认知层次分类法,包含语义和 GUI 控制的双动作空间,并通过先进 VLMs 实现里程碑评估,以量化进展。我们的实验表明,VLMs 从视频反思中受益于在各种设置下表现良好,最佳表现方式是结合失败轨迹和专家教程——一种无需训练的强化学习(RL)加监督微调(SFT)的类方法。我们的项目页面位于 https://gameverse-bench.github.io/。我们的代码位于 https://github.com/THUSI-Lab/GameVerse。

关键词

引用

@article{arxiv.2603.06656,
  title  = {GameVerse: Can Vision-Language Models Learn from Video-based Reflection?},
  author = {Kuan Zhang and Dongchen Liu and Qiyue Zhao and Jinkun Hou and Xinran Zhang and Qinlei Xie and Miao Liu and Yiming Li},
  journal= {arXiv preprint arXiv:2603.06656},
  year   = {2026}
}

备注

https://gameverse-bench.github.io/