中文

Game-RL:用于提升视觉语言模型通用推理能力的多模态可验证游戏数据合成

计算与语言 2025-12-12 v8

摘要

视觉语言强化学习(RL)主要聚焦于狭窄领域(如几何或图表推理),这导致更广泛的训练场景和资源得到 insufficient 关注,限制了视觉语言模型(VLMs)通过RL进行探索和学习。我们发现视频游戏天然提供丰富的视觉元素和可验证的机制。为充分利用视频游戏中的多模态和可验证奖励,我们提出Game-RL,通过构建多样化的游戏任务进行RL训练以提升VLMs的通用推理能力。为获取训练数据,我们提出Code2Logic,将游戏代码适应以合成游戏推理任务数据,从而获得包含30个游戏和158个任务的可控难度梯度的GameQA数据集。意外的是,仅凭GameQA进行RL训练即可使多个VLMs在7个多样化的视觉语言基准测试中实现性能提升,证明了Game-RL对于增强VLMs通用推理能力的价值。此外,这表明视频游戏可能作为提升通用推理能力的有价值场景和资源。我们的代码、数据集和模型均已在GitHub仓库中提供。

关键词

引用

@article{arxiv.2505.13886,
  title  = {Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning},
  author = {Jingqi Tong and Jixin Tang and Hangcheng Li and Yurong Mou and Ming Zhang and Jun Zhao and Yanbo Wen and Fan Song and Jiahao Zhan and Yuyang Lu and Chaoran Tao and Zhiyuan Guo and Jizhou Yu and Tianhao Cheng and Zhiheng Xi and Changhao Jiang and Zhangyue Yin and Yining Zheng and Weifeng Ge and Guanhua Chen and Tao Gui and Xipeng Qiu and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2505.13886},
  year   = {2025}
}

备注

69 pages, 24 figures