中文

基于参数化技能与先验知识的高效自动驾驶强化学习

机器人学 2023-05-09 v1 人工智能 机器学习

摘要

当自动驾驶车辆部署于公共道路时,会遭遇无数且多样的驾驶情境。许多人工设计的驾驶策略难以扩展到真实世界。幸运的是,强化学习(reinforcement learning, RL)已通过自动试错在许多任务中取得巨大成功。然而,在交互密集交通中进行自动驾驶时,RL 智能体要么无法学习到合理的性能,要么需要大量数据。我们的洞见是:人类学习驾驶时会 1)在高层技能空间而非底层控制空间做决策,以及 2)利用专家先验知识而非从零学习。受此启发,我们提出 ASAP-RL,一种同时利用运动技能与专家先验的高效自动驾驶强化学习算法。我们首先参数化了运动技能,其多样性足以覆盖各种复杂驾驶场景与情境。提出一种技能参数逆恢复方法,将专家演示从控制空间转换至技能空间。提出一种简单而有效的双重初始化技术,在规避专家次优性与早期性能退化问题的同时利用专家先验。我们在给定简单且稀疏奖励的交互密集交通驾驶任务上验证了所提方法。实验结果表明,相较于以往以不同方式利用技能与先验的方法,我们的方法能带来更高的学习效率和更好的驾驶性能。代码已开源以促进进一步研究。

关键词

引用

@article{arxiv.2305.04412,
  title  = {Efficient Reinforcement Learning for Autonomous Driving with Parameterized Skills and Priors},
  author = {Letian Wang and Jie Liu and Hao Shao and Wenshuo Wang and Ruobing Chen and Yu Liu and Steven L. Waslander},
  journal= {arXiv preprint arXiv:2305.04412},
  year   = {2023}
}

备注

Robotics: Science and Systems (RSS 2023)