中文

驾驶情景的自动课程学习:面向强化学习的鲁棒性与效率提升

机器人学 2026-03-06 v3 人工智能

摘要

本文解决使用强化学习(RL)训练 end-to-end 自动驾驶智能体的挑战。RL 智能体通常在固定情景集合和模拟中围绕道路用户的 nominal 行为中进行训练,这限制了其泛化能力和实际部署。虽然 domain randomization 通过随机抽样驾驶情景可作为潜在解决方案,但常导致训练效率低下和次优策略,因为训练情景之间的方差较大。为缓解此限制,我们提出一种自动课程学习框架,动态生成基于智能体不断演化能力所决定的自适应复杂度驾驶情景。不同于手动设计的课程引入专家偏见且缺乏可扩展性,我们的框架包含一个 "teacher",自动生成和变异驾驶情景,依据其学习潜力——源自智能体当前策略的 agent-centric 指标——无需专家设计。该框架通过排除智能体已掌握或认为过于具有挑战性的情景来提升训练效率。我们在强化学习设置中评估了该框架,智能体从摄像头图像中学习驾驶策略。与基线方法(包括固定情景训练和 domain randomization)的比较结果表明,我们的方法实现了更好的泛化,低交通密度情景成功率提升 9%,高交通密度情景成功率提升 21%,并以更少的训练步数实现更快收敛。我们的发现凸显了 ACL 在提升基于 RL 的自动驾驶智能体鲁棒性和效率方面的潜力。

关键词

引用

@article{arxiv.2505.08264,
  title  = {Automatic Curriculum Learning for Driving Scenarios: Towards Robust and Efficient Reinforcement Learning},
  author = {Ahmed Abouelazm and Tim Weinstein and Tim Joseph and Philip Schörner and J. Marius Zöllner},
  journal= {arXiv preprint arXiv:2505.08264},
  year   = {2026}
}

备注

Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025)