带基于模型探索的 DQN:在稀疏奖励环境下的高效学习
机器学习
2019-03-25 v1 机器学习
摘要
我们提出带基于模型探索的 Deep Q-Networks (DQN),一种结合无模型与基于模型方法、探索更优且能更高效学习稀疏奖励环境的算法。DQN 是一种通用、无模型的算法,自 Minh 等人首次提出以来已被证明在包括 Atari 2600 游戏在内的多种任务中表现良好。然而,像许多其他强化学习 (RL) 算法一样,DQN 在环境奖励稀疏时样本效率低下。结果,存储在回放记忆中的大多数转移没有信息性奖励信号,对 Q 网络的收敛与训练价值有限。但一个洞见是,这些转移可作为监督学习问题用于学习环境动态。这些转移还提供了已访问状态分布的信息。我们的算法利用这两点观察在探索期间执行一步规划,以选择导向最不可能被看到状态的动作,从而提升探索性能。我们在 OpenAI gym 的两个经典稀疏奖励环境——Mountain Car 和 Lunar Lander 中展示了智能体的性能。
引用
@article{arxiv.1903.09295,
title = {DQN with model-based exploration: efficient learning on environments with sparse rewards},
author = {Stephen Zhen Gou and Yuyang Liu},
journal= {arXiv preprint arXiv:1903.09295},
year = {2019}
}