中文

基于演示的深度 Q 学习

人工智能 2017-11-27 v4 机器学习

摘要

深度强化学习(RL)在困难决策问题中已取得若干重大成功。然而,这些算法通常在达到合理性能前需要海量数据。事实上,它们在学习过程中的表现可能极差。这对于模拟器或许可以接受,但严重限制了深度 RL 对许多真实世界任务的适用性,因为智能体必须在真实环境中学习。本文研究一种智能体可访问系统先前控制数据的设定。我们提出一种算法,即基于演示的深度 Q 学习(DQfD),其利用少量演示数据集来大幅加速学习过程,即便演示数据量相对较少,并且得益于优先回放机制,能够在学习时自动评估所需的演示数据比例。DQfD 通过结合时间差分更新与对演示者动作的监督分类来工作。我们表明,DQfD 比优先对决双重深度 Q 网络(PDD DQN)具有更好的初始性能,因为在 42 个游戏中的 41 个上,它以更好的分数起步于前百万步,且平均而言 PDD DQN 需要 8300 万步才能赶上 DQfD 的性能。DQfD 学会在 42 个游戏中的 14 个上超越所给的最佳演示。此外,DQfD 利用人类演示在 11 个游戏上取得了最先进的结果。最后,我们展示 DQfD 优于三种将演示数据融入 DQN 的相关算法。

关键词

引用

@article{arxiv.1704.03732,
  title  = {Deep Q-learning from Demonstrations},
  author = {Todd Hester and Matej Vecerik and Olivier Pietquin and Marc Lanctot and Tom Schaul and Bilal Piot and Dan Horgan and John Quan and Andrew Sendonaris and Gabriel Dulac-Arnold and Ian Osband and John Agapiou and Joel Z. Leibo and Audrunas Gruslys},
  journal= {arXiv preprint arXiv:1704.03732},
  year   = {2017}
}

备注

Published at AAAI 2018. Previously on arxiv as "Learning from Demonstrations for Real World Reinforcement Learning"