中文

共享学习:增强 $Q$-集成中的强化学习

机器学习 2017-09-15 v1 人工智能

摘要

深度强化学习(Deep Reinforcement Learning)通过试图最大化累积奖励,已在从视频游戏到连续控制的各种领域中取得惊人成功。然而,这些成功大多依赖于需要大量数据训练的算法,以获得与人类水平相当的性能。如果我们要将这些系统部署到真实世界任务中,这是不可行的,因此探索数据高效算法的动力不断增加。为此,我们提出了共享学习(Shared Learning)框架,旨在使 QQ-集成(QQ-ensemble)算法具有数据高效性。为实现这一点,我们研究了迁移学习的一些原理,这些原理旨在研究强化学习中跨任务信息交换的益处,并以一种新颖的方式使迁移适应于学习我们的价值函数估计。在本文中,我们考虑了在BootstrappedDQN的 QQ-集成架构中价值函数估计之间迁移的特殊情况。我们进一步通过经验证明,在Atari 2600游戏套件上,我们提出的框架如何能够以最小的计算开销加速 QQ-集成中的学习过程。

关键词

引用

@article{arxiv.1709.04909,
  title  = {Shared Learning : Enhancing Reinforcement in $Q$-Ensembles},
  author = {Rakesh R Menon and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:1709.04909},
  year   = {2017}
}

备注

Submitted to AAAI 2018