通过合成世界中的强化学习提升视觉语言模型训练,实现真实世界成功
机器学习
2025-08-07 v1 人工智能
摘要
交互式多模态智能体必须将原始视觉观察转换为以语言为条件的连贯动作序列——这是当前视觉语言模型(VLM)仍不具备的能力。早期的强化学习(RL)努力理论上可以赋予VLM以此类技能,但很少有研究测试所学行为是否能超越训练模拟器,亦或依赖脆弱的超参数调优或低状态变异性的稠密奖励环境。我们引入Vision-Language Decoupled Actor-Critic(VL-DAC),一种轻量级、无需调参的RL算法。VL-DAC将动作标记应用PPO更新,仅在环境步骤级别学习价值——这是我们据了解首次用于大型VLM或LLM的安排。这种简单的解耦去除了不稳定的加权项,实现了更快、更可靠的收敛。仅在一次廉价模拟器中(MiniWorld、Gym-Cards、ALFWorld或WebShop)训练单个VLM,即可获得广泛的政策泛化能力:在BALROG(以游戏为中心的智能体控制)上实现约50%的相对提升,在VSI-Bench最具挑战性的部分实现约5%的相对提升,在VisualWebBench上实现约2%的提升,且未损害一般图像理解准确性。这些结果首次证明,简单且高效的RL算法可以完全在廉价的合成世界中训练VLM,同时在真实图像的智能体、空间推理和网页导航基准测试中实现可衡量的提升。
引用
@article{arxiv.2508.04280,
title = {Enhancing Vision-Language Model Training with Reinforcement Learning in Synthetic Worlds for Real-World Success},
author = {George Bredis and Stanislav Dereka and Viacheslav Sinii and Ruslan Rakhimov and Daniil Gavrilov},
journal= {arXiv preprint arXiv:2508.04280},
year = {2025}
}