中文

在自动驾驶中学习预测表示以改进深度强化学习

机器学习 2020-06-29 v1 机器人学

摘要

使用一种新颖预测表示的强化学习被应用于自动驾驶,以完成在车道标线间行驶的任务,在仿真和真实Jackal机器人上未见测试道路上均观察到性能与泛化的显著收益。该新颖预测表示由通用值函数(GVFs)学习,提供关于未来车道中心度和道路角度的离策略(或反事实)预测,形成智能体状态的紧凑表示,改善在线与离线强化学习中的学习,以学习方法驾驶自动驾驶车辆并良好泛化至非训练数据中的道路。仿真与真实世界的实验表明,强化学习中的预测表示提升了学习效率、控制平滑度以及对训练期间未见过道路(包括受损车道标线)的泛化能力。研究发现,学习由不同时间尺度或折扣因子上的多个预测组成的预测表示可大幅改善性能与控制平滑度。Jackal机器人以两步流程训练:先学习预测表示,随后通过环境中自动化与人工引导探索收集的数据使用批量强化学习算法(BCQ)。我们得出结论,带GVFs的离策略预测表示为现实世界问题的强化学习提供了诸多益处。

关键词

引用

@article{arxiv.2006.15110,
  title  = {Learning predictive representations in autonomous driving to improve deep reinforcement learning},
  author = {Daniel Graves and Nhat M. Nguyen and Kimia Hassanzadeh and Jun Jin},
  journal= {arXiv preprint arXiv:2006.15110},
  year   = {2020}
}