中文

面向城市自动驾驶的基于模型的引导策略搜索强化学习

机器人学 2020-05-12 v2

摘要

在本文中,我们延续先前关于使用模仿学习(IL)和无模型强化学习(RL)来学习城市场景下自动驾驶策略的工作,引入一种基于模型的RL方法,在Carla城市驾驶模拟器中驱动自动驾驶车辆。尽管IL和无模型RL方法已被证明能够解决许多具有挑战性的任务,包括电子游戏、机器人以及我们先前工作中的城市驾驶,但此类方法的低样本效率极大地限制了它们在实际自动驾驶中的应用。在这项工作中,我们为城市驾驶任务开发了一种基于模型的引导策略搜索(GPS)RL算法。该算法迭代地学习参数化动力学模型以近似复杂且交互性的驾驶任务,并在非线性近似动力学模型下优化驾驶策略。作为一种基于模型的RL方法,当应用于城市自动驾驶时,GPS具有更高的样本效率、更好的可解释性和更强的稳定性等优势。我们提供了大量实验来验证所提方法在Carla中学习鲁棒城市驾驶策略的有效性。我们还将所提方法与其它策略搜索和无模型RL基线进行了比较,显示出基于GPS的RL方法具有100倍的样本效率提升,并且基于GPS的方法能够学习基线方法难以学习的更困难任务的策略。

关键词

引用

@article{arxiv.2005.03076,
  title  = {Guided Policy Search Model-based Reinforcement Learning for Urban Autonomous Driving},
  author = {Zhuo Xu and Jianyu Chen and Masayoshi Tomizuka},
  journal= {arXiv preprint arXiv:2005.03076},
  year   = {2020}
}