中文

绕过仿真到现实的鸿沟:利用监督器的在线强化学习

机器人学 2023-07-14 v2

摘要

深度强化学习(DRL)是一种仅从演示和经验中学习机器人控制策略的有前景的方法。为覆盖机器人的全部动态行为,DRL训练是一种通常在仿真环境中进行的主动探索过程。尽管这种仿真训练廉价且快速,但将DRL算法应用于现实世界环境是困难的。如果智能体在仿真中训练到安全执行,由于仿真动力学与物理机器人之间的差异所导致的仿真到现实鸿沟(sim-to-real gap),将它们转移到物理系统是困难的。在本文中,我们提出了一种通过使用基于模型的安全监督器在线训练DRL智能体以在物理车辆上自主驾驶的方法。我们的解决方案使用监督系统来检查智能体选择的动作是安全还是不安全,并确保始终在车辆上执行安全动作。由此,我们可以在安全地、快速且高效地训练DRL算法的同时绕过仿真到现实问题。我们将我们的方法与常规仿真训练和物理车辆上的训练进行比较。我们提供了多种现实世界实验,在其中我们在线训练小型车辆自主驾驶而无需先验仿真训练。评估结果表明,我们的方法以更高的样本效率训练智能体且从不碰撞,并且训练出的智能体表现出优于仿真训练智能体的驾驶性能。

关键词

引用

@article{arxiv.2209.11082,
  title  = {Bypassing the Simulation-to-reality Gap: Online Reinforcement Learning using a Supervisor},
  author = {Benjamin David Evans and Johannes Betz and Hongrui Zheng and Herman A. Engelbrecht and Rahul Mangharam and Hendrik W. Jordaan},
  journal= {arXiv preprint arXiv:2209.11082},
  year   = {2023}
}

备注

7 Pages, 10 Figures, 1 Table