IRL-VLA: 通过奖励世界模型训练视觉语言动作策略
人工智能
2025-08-18 v3 计算机视觉与模式识别
机器人学
摘要
视觉语言动作(VLA)模型在自主驾驶中展现出巨大潜力。然而,两大关键挑战仍制约其发展:(1)现有VLA架构通常基于开环设置下的模仿学习,倾向于捕获数据集中记录的行为,导致次优且受限的性能;(2)闭环训练高度依赖高保真传感器仿真,其中领域差距和计算效率问题构成重大障碍。本文引入IRL-VLA,一种通过反向强化学习奖励世界模型实现闭环强化学习的VVL方法。我们的框架采用三个阶段的范式:在第一个阶段,我们提出VLA架构并通过模仿学习预训练VLA策略。在第二个阶段,我们通过反向强化学习构建轻量级奖励世界模型,以实现高效的闭环奖励计算。为进一步提升规划性能,我们最后设计了基于PPO(近似策略优化)的奖励世界模型指导强化学习,以有效平衡安全事件、舒适驾驶和交通效率。我们的方法在NAVSIM v2端到端驾驶基准中实现了最先进的性能,在CVPR2025 Autonomous Grand Challenge中获得第1名亚军。我们希望我们的框架将加速视觉语言动作在闭环自主驾驶中的研究。
引用
@article{arxiv.2508.06571,
title = {IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model},
author = {Anqing Jiang and Yu Gao and Yiru Wang and Zhigang Sun and Shuo Wang and Yuwen Heng and Hao Sun and Shichen Tang and Lijuan Zhu and Jinhao Chai and Jijun Wang and Zichong Gu and Hao Jiang and Li Sun},
journal= {arXiv preprint arXiv:2508.06571},
year = {2025}
}
备注
9 pagres, 2 figures