面向样本高效深度强化学习的生成对抗想象
机器学习
2019-06-12 v2 人工智能
机器学习
摘要
强化学习在过去五年中取得了巨大进展。将深度学习引入以取代更传统的方法,使强化学习能够扩展到非常复杂的领域,在围棋或众多视频游戏等环境中达到超人类表现。尽管在多个领域取得了巨大成功,这些新方法也存在自身的问题,使其往往难以应用于现实世界问题。极度缺乏数据效率,加上巨大的方差以及难以强制安全约束,是该领域最突出的三个问题之一。通常,这些算法需要从环境中采样数百万个数据点才能收敛到可接受策略。本文提出一种新颖的生成对抗想象强化学习算法。它利用近期引入的高效生成对抗模型,以及支撑强化学习设定的马尔可夫性质,在内部想象模块中建模真实环境的动态。随后,来自想象的 rollout 被用于在标准强化学习过程中人为模拟真实环境,以避免在真实环境中往往昂贵且危险的试错。实验结果表明,所提算法比当前最先进的 Rainbow DQN 算法更经济地利用来自真实环境的经验,从而向样本高效深度强化学习迈出了重要一步。
引用
@article{arxiv.1904.13255,
title = {Generative Adversarial Imagination for Sample Efficient Deep Reinforcement Learning},
author = {Kacper Kielak},
journal= {arXiv preprint arXiv:1904.13255},
year = {2019}
}