中文

CarPlanner:面向自动驾驶大规模强化学习的一致性自回归轨迹规划

机器人学 2025-03-25 v3 计算机视觉与模式识别 机器学习

摘要

轨迹规划对于自动驾驶至关重要,它确保了在复杂环境中的安全高效导航。虽然近期基于学习的方法,特别是强化学习(RL),在特定场景中显示出潜力,但RL规划器在训练效率低下和管理大规模真实世界驾驶场景方面存在困难。在本文中,我们介绍了\textbf{CarPlanner},一个使用RL生成多模态轨迹的\textbf{C}onsistent \textbf{a}uto-\textbf{r}egressive \textbf{Planner}(一致性自回归规划器)。自回归结构实现了高效的大规模RL训练,而一致性的引入通过保持时间步间连贯的时间一致性来确保稳定的策略学习。此外,CarPlanner采用生成-选择框架,配备专家引导的奖励函数和不变视图模块,简化了RL训练并提升了策略性能。广泛的分析表明,我们提出的RL框架有效解决了训练效率和性能提升的挑战,使CarPlanner成为自动驾驶轨迹规划的一个有前景的解决方案。据我们所知,我们是第一个证明基于RL的规划器能够在具有挑战性的大规模真实世界数据集nuPlan上超越基于IL和基于规则的SOTA方法。我们提出的CarPlanner在这个要求严苛的数据集上超越了基于RL、IL和规则的SOTA方法。

关键词

引用

@article{arxiv.2502.19908,
  title  = {CarPlanner: Consistent Auto-regressive Trajectory Planning for Large-scale Reinforcement Learning in Autonomous Driving},
  author = {Dongkun Zhang and Jiaming Liang and Ke Guo and Sha Lu and Qi Wang and Rong Xiong and Zhenwei Miao and Yue Wang},
  journal= {arXiv preprint arXiv:2502.19908},
  year   = {2025}
}

备注

CVPR 2025