中文

利用强与弱人类监督且无需模拟器的机器人任务深度学习

人工智能 2017-03-28 v3 机器学习 机器人学

摘要

我们提出了一种训练计算机化智能体以执行复杂人类任务(如高速公路转向)的方案。该方案旨在遵循一种自然学习过程,即由人类指导者教导计算机化受训者。该学习过程包含五个要素:(i) 无监督特征学习;(ii) 有监督模仿学习;(iii) 有监督奖励诱导;(iv) 有监督安全模块构建;以及 (v) 强化学习。我们使用深度卷积网络实现了该方案的最后四个要素,并将其应用于著名的赛车游戏 Assetto Corsa,成功创建了一个能够自主进行高速公路转向的计算机化智能体。我们证明,仅使用视觉、无法访问驾驶模拟器内部状态且在实时时钟下运行,最后四个要素的使用对于有效执行转向任务是必不可少的。这还得益于安全网络的引入,这是一种在强化学习阶段防止智能体犯灾难性错误的新颖方法。

关键词

引用

@article{arxiv.1612.01086,
  title  = {Deep Learning of Robotic Tasks without a Simulator using Strong and Weak Human Supervision},
  author = {Bar Hilleli and Ran El-Yaniv},
  journal= {arXiv preprint arXiv:1612.01086},
  year   = {2017}
}