中文

RoaD:基于 rollouts 的闭环监督微调自主驾驶策略

机器人学 2025-12-02 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

自主驾驶策略通常通过开环行为克隆的人类演示进行训练。然而,这些策略在闭环部署时会出现协变量漂移,导致误差叠加。我们引入 rollouts 作为演示(RoaD),一种简单且高效的方法,通过利用策略自身的闭环 rollouts 作为额外训练数据来缓解协变量漂移。在生成 rollouts 时,RoaD 融入专家指导以偏向高质量行为,产生具有信息性且真实实验的演示,用于微调。该方法通过远小于强化学习的数据量实现稳健的闭环适应,避免了先前闭环监督微调(CL-SFT)方法的限制性假设,使其能够适用于更广泛的应用领域,包括端到端驾驶。我们在WOSAC(大规模交通仿真基准)上展示了RoaD的有效性,其表现与先前的CL-SFT方法相当或更好;在AlpaSim(基于神经重建的高保真仿真器)中实现端到端驾驶,其中驾驶得分提升41%,碰撞减少54%。

关键词

引用

@article{arxiv.2512.01993,
  title  = {RoaD: Rollouts as Demonstrations for Closed-Loop Supervised Fine-Tuning of Autonomous Driving Policies},
  author = {Guillermo Garcia-Cobo and Maximilian Igl and Peter Karkus and Zhejun Zhang and Michael Watson and Yuxiao Chen and Boris Ivanovic and Marco Pavone},
  journal= {arXiv preprint arXiv:2512.01993},
  year   = {2025}
}

备注

Preprint