中文

基于端到端可微仿真的自动驾驶车辆控制器

人工智能 2025-11-19 v2 机器人学

摘要

当前学习自动驾驶车辆控制器的方法侧重于行为克隆。由于仅在精确的历史数据上进行训练,生成的智能体通常难以泛化到新场景。仿真器提供了超越离线数据集的机会,但它们仍被视为复杂的黑盒,仅用于更新全局仿真状态。因此,这些 RL 算法速度慢、样本效率低且与先验无关。在这项工作中,我们利用可微仿真器,设计了一种解析策略梯度(APG)方法,在大规模 Waymo Open Motion Dataset 上训练 AV 控制器。我们提出的框架将可微仿真器引入端到端训练循环,其中环境动力学的梯度作为有用的先验,帮助智能体学习更扎实的策略。我们将此设置与一种能够沿长仿真轨迹高效传播时间信息的循环架构相结合。这种 APG 方法使我们能够学习稳健、准确且快速的策略,同时只需要广泛可用的专家轨迹,而不是稀缺的专家动作。我们与行为克隆进行了比较,发现其在性能和对动力学噪声的鲁棒性方面有显著提升,并且整体上具有更直观的类人驾驶行为。

关键词

引用

@article{arxiv.2409.07965,
  title  = {Autonomous Vehicle Controllers From End-to-End Differentiable Simulation},
  author = {Asen Nachkov and Danda Pani Paudel and Luc Van Gool},
  journal= {arXiv preprint arXiv:2409.07965},
  year   = {2025}
}

备注

Polished and accepted at IROS 2025