VDRive: 利用强化VLA与扩散策略实现端到端自动驾驶
机器人学
2026-02-11 v2
摘要
在自动驾驶中,动态环境和边缘情况对自车状态理解和决策制定的鲁棒性构成了重大挑战。我们引入了VDRive,一种用于端到端自动驾驶的新型流水线,它显式地对状态-动作映射进行建模以应对这些挑战,从而实现可解释且鲁棒的决策制定。通过利用视觉语言动作模型(VLA)在状态理解方面的进步,并结合基于生成式扩散策略的动作头,我们的VDRive在上下文和几何两个层面引导驾驶。在上下文层面,VLA通过令牌生成预训练预测未来观测,其中观测由条件向量量化变分自编码器(CVQ-VAE)表示为离散编码。在几何层面,我们对VLA进行强化学习微调,以根据当前驾驶条件预测未来轨迹和动作。VLA为动作策略头提供当前状态令牌和预测状态令牌,以生成分层动作和轨迹。在策略训练期间,一个学习到的评判器评估策略生成的动作并提供基于梯度的反馈,形成一个行动者-评判器框架,从而实现基于强化的策略学习流水线。实验表明,我们的VDRive在Bench2Drive闭环基准测试和nuScenes开环规划中均达到了最先进的性能。
引用
@article{arxiv.2510.15446,
title = {VDRive: Leveraging Reinforced VLA and Diffusion Policy for End-to-end Autonomous Driving},
author = {Ziang Guo and Zufeng Zhang},
journal= {arXiv preprint arXiv:2510.15446},
year = {2026}
}
备注
WIP