中文

面向样本高效深度强化学习的生成对抗想象

机器学习 2019-06-12 v2 人工智能 机器学习

摘要

强化学习在过去五年中取得了巨大进展。将深度学习引入以取代更传统的方法,使强化学习能够扩展到非常复杂的领域,在围棋或众多视频游戏等环境中达到超人类表现。尽管在多个领域取得了巨大成功,这些新方法也存在自身的问题,使其往往难以应用于现实世界问题。极度缺乏数据效率,加上巨大的方差以及难以强制安全约束,是该领域最突出的三个问题之一。通常,这些算法需要从环境中采样数百万个数据点才能收敛到可接受策略。本文提出一种新颖的生成对抗想象强化学习算法。它利用近期引入的高效生成对抗模型,以及支撑强化学习设定的马尔可夫性质,在内部想象模块中建模真实环境的动态。随后,来自想象的 rollout 被用于在标准强化学习过程中人为模拟真实环境,以避免在真实环境中往往昂贵且危险的试错。实验结果表明,所提算法比当前最先进的 Rainbow DQN 算法更经济地利用来自真实环境的经验,从而向样本高效深度强化学习迈出了重要一步。

关键词

引用

@article{arxiv.1904.13255,
  title  = {Generative Adversarial Imagination for Sample Efficient Deep Reinforcement Learning},
  author = {Kacper Kielak},
  journal= {arXiv preprint arXiv:1904.13255},
  year   = {2019}
}