中文

CorrectionPlanner:基于强化学习的自纠正规划器用于自动驾驶

机器人学 2026-03-18 v1 人工智能

摘要

自动驾驶需要安全的规划,但大多数基于学习的规划器缺乏明确的自纠正能力:一旦提出不安全的动作,就没有机制对其进行纠正。因此,我们提出了 CorrectionPlanner,这是一种具有自纠正能力的自回归规划器,将规划建模为在提出、评估和纠正循环中进行运动标记的生成。在每一步规划中,策略提出一个动作,即一个运动标记,学习的碰撞批评家预测该动作是否会在短时间范围内导致碰撞。如果批评家预测将导致碰撞,我们保留历史不安全运动标记序列作为自纠正痕迹,生成下一个运动标记时以其为条件,重复此过程,直到提出安全的运动标记或满足安全准则。这个自纠正痕迹由所有不安全运动标记组成,代表了运动标记空间中规划器的纠正过程,类似于语言模型中的推理痕迹。我们使用模仿学习随后采用基于模型的强化学习来训练规划器,利用来自预训练世界模型的 rollout,这些模型真实地建模了代理人的反应行为。封闭环评估表明,CorrectionPlanner 在 Waymax 上的碰撞率降低了超过 20%,并在 nuPlan 上实现了最先进的规划得分。

关键词

引用

@article{arxiv.2603.15771,
  title  = {CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving},
  author = {Yihong Guo and Dongqiangzi Ye and Sijia Chen and Anqi Liu and Xianming Liu},
  journal= {arXiv preprint arXiv:2603.15771},
  year   = {2026}
}