AutoDrive-R²:激励 VLA 模型推理与自省能力的自动驾驶系统
机器人学
2026-04-20 v3 计算机视觉与模式识别
摘要
视觉语言-动作(VLA)模型在自动驾驶系统中最近显示出通过整合多模态感知与决策能力的变革性潜力。然而,决策过程的可解释性和连贯性,以及行动序列的合理性,仍基本未被探讨。为此,我们提出AutoDrive-R²,一种新的VLA框架,通过链式思维(CoT)处理和强化学习(RL)来增强自动驾驶系统的推理与自省能力。具体而言,我们首先提出一种创新的CoT数据集,称为nuScenesR²-6K,用于监督式微调,有效地通过包含自省验证的四步逻辑链,构建输入信息与输出轨迹之间的认知桥梁。此外,为最大化推理和自省在RL阶段的表现,进一步采用组相对策略优化(GRPO)算法 within 一个基于物理的奖励框架,该框架整合了空间对齐、车辆动力学和时间平滑性准则,以确保可靠且逼真的轨迹规划。广泛的评估结果表明,我们的方法在nuScenes和Waymo数据集上实现了领先的性能和稳健的泛化能力。
引用
@article{arxiv.2509.01944,
title = {AutoDrive-R$^2$: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving},
author = {Zhenlong Yuan and Chengxuan Qian and Jing Tang and Rui Chen and Zijian Song and Lei Sun and Xiangxiang Chu and Yujun Cai and Dapeng Zhang and Shuo Li},
journal= {arXiv preprint arXiv:2509.01944},
year = {2026}
}