中文

Odysseus:通过强化学习将 VLMs 扩展至 100+ 回合决策游戏

机器学习 2026-05-04 v1 人工智能 计算与语言

摘要

鉴于视觉语言模型 (VLM) 能力的快速提升,将其扩展到诸如视频游戏等交互式决策任务已成为一个有前景的方向。然而,现有方法要么依赖大规模监督微调人类轨迹,要么仅在相对短暂的时段(通常约 20--30 回合)中应用强化学习。本文我们研究了在超级马里奥兰 (Super Mario Land) 中进行基于强化学习的 VLMs 训练,以实现 100+ 回合的交互式决策,这需要协调的感知、推理与行动。我们首先对关键算法组件进行系统性调查,并提出一种针对 PPO 的改进版本,采用轻量级回合级评论家,显著改善了训练稳定性和样本效率,优于无评论家方法如 GRPO 和 Reinforce++。我们进一步表明,预训练 VLMs 提供强大的行动先验,大幅提高了强化学习训练中的样本效率,减少了对诸如行动工程等手动设计选择的需求,这与从头训练的经典深度强化学习形成鲜明对比。基于这些见解,我们引入 Odysseus,一个用于 VLM 代理的开放训练框架,在游戏的多个水平上实现了显著提升,平均游戏进程至少提升 3 倍。此外,训练好的模型在包括内游戏和跨游戏泛化设置下均表现出一致的改进,同时保持通用领域能力。总体而言,我们的结果识别了在长期、多模态环境中使强化学习稳定有效的关键要素,并为开发 VLMs 作为具身智能体提供了实用指导。

关键词

引用

@article{arxiv.2605.00347,
  title  = {Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning},
  author = {Chengshuai Shi and Wenzhe Li and Xinran Liang and Yizhou Lu and Wenjia Yang and Ruirong Feng and Seth Karten and Ziran Yang and Zihan Ding and Gabriel Sarch and Danqi Chen and Karthik Narasimhan and Chi Jin},
  journal= {arXiv preprint arXiv:2605.00347},
  year   = {2026}
}