中文

Drive-R1:用于自主驾驶的强化学习中桥接推理与规划

计算机视觉与模式识别 2025-06-24 v1 机器人学

摘要

针对自主驾驶 (AD) 的大型视觉语言模型 (VLM) 正在从感知和认知任务演进到运动规划。然而,我们识别出两个关键挑战:(1) VLM 倾向于通过过度依赖历史输入信息学习捷径,实现看似较强的规划结果而未真正理解视觉输入;(2) chain-of-thought (COT) 推理过程始终与运动规划结果错位,如何有效利用复杂推理能力来增强规划仍基本未被探索。本文从小规模领域特定 VLM 开始,提出 Drive-R1 用于桥接 AD 的情景推理与运动规划。Drive-R1 首先在包含长短 COT 数据的详尽数据集上进行监督式微调。Drive-R1 被鼓励从视觉输入一步步推理至最终规划决策。随后,Drive-R1 在强化学习框架中进行训练,以激励发现对规划更具信息性的推理路径,依据预测轨迹和 meta action 的奖励进行引导。在 nuScenes 和 DriveLM-nuScenes 基准测试中的实验评估表明,Drive-R1 的性能优于现有的 state-of-the-art VLM。我们认为,Drive-R1 为 AD 中推理与规划的衔接提供了有前景的方向,为未来研究和应用提供了方法论见解。

关键词

引用

@article{arxiv.2506.18234,
  title  = {Drive-R1: Bridging Reasoning and Planning in VLMs for Autonomous Driving with Reinforcement Learning},
  author = {Yue Li and Meng Tian and Dechang Zhu and Jiangtong Zhu and Zhenyu Lin and Zhiwei Xiong and Xinhai Zhao},
  journal= {arXiv preprint arXiv:2506.18234},
  year   = {2025}
}