中文

Gen-Drive:通过奖励建模和强化学习微调增强扩散生成式驾驶策略

机器人学 2024-10-10 v1

摘要

自动驾驶需要具备推理交通参与者之间未来交互的能力,并为规划做出明智的评估。本文介绍了\textit{Gen-Drive}框架,该框架从传统的预测和确定性规划框架转变为“先生成后评估”的规划范式。该框架采用行为扩散模型作为场景生成器,以生成多样化的可能未来场景,从而增强联合交互推理的能力。为了促进决策制定,我们提出了一个场景评估器(奖励)模型,该模型使用通过VLM辅助收集的成对偏好数据进行训练,从而减少了人工工作量并增强了可扩展性。此外,我们利用一个强化学习微调框架来提升扩散模型的生成质量,使其更有效地用于规划任务。我们在nuPlan数据集上进行了训练和闭环规划测试,结果表明采用这种“先生成后评估”策略优于其他基于学习的方法。此外,微调后的生成式驾驶策略在规划性能上显示出显著提升。我们进一步证明,与依赖人工设计的奖励相比,使用我们学习到的奖励模型进行评估或强化学习微调能带来更好的规划性能。项目网站:https://mczhi.github.io/GenDrive。

关键词

引用

@article{arxiv.2410.05582,
  title  = {Gen-Drive: Enhancing Diffusion Generative Driving Policies with Reward Modeling and Reinforcement Learning Fine-tuning},
  author = {Zhiyu Huang and Xinshuo Weng and Maximilian Igl and Yuxiao Chen and Yulong Cao and Boris Ivanovic and Marco Pavone and Chen Lv},
  journal= {arXiv preprint arXiv:2410.05582},
  year   = {2024}
}