中文

通过游戏学习:通过游戏推理的能力

计算机视觉与模式识别 2025-10-10 v4 计算与语言

摘要

发展多模态大语言模型(MLLMs)中的推理能力仍然具有挑战性。受鼓励于表明游戏促进可迁移推理技能的文献,我们提出了一种新颖的后训练方法,Visual Game Learning(ViGaL),其中 MLLMs 通过玩 arcade 类游戏来发展通用推理技能。具体我们展示,通过在简单游戏如 Snake 上进行强化学习(RL)训练的 7B 参数模型,显著提升了在多模态数学基准测试如 MathVista、多学科问题如 MMMU 以及 3D 空间推理基准测试如 VSI-Bench 上的下游性能,而在 RL 期间没有看到任何 worked solution、方程或图表。惊人的是,我们的模型在未针对多模态推理数据进行专门训练的专家模型后训练后表现更好,同时保持了在通用视觉基准测试上的性能——这是一个专家模型经常不足之处。我们的发现表明,多模态推理可以从游戏中涌现出来,指向设计用于 RL 后训练的代理任务的有前景的策略。

关键词

引用

@article{arxiv.2506.08011,
  title  = {Play to Generalize: Learning to Reason Through Game Play},
  author = {Yunfei Xie and Yinsong Ma and Shiyi Lan and Alan Yuille and Junfei Xiao and Chen Wei},
  journal= {arXiv preprint arXiv:2506.08011},
  year   = {2025}
}

备注

Project Page: https://yunfeixie233.github.io/ViGaL/