微目标学习:通过发现连续子目标加速深度强化学习
人工智能
2017-03-14 v1
摘要
近年来,强化学习已成功应用于逻辑游戏围棋、各类Atari游戏乃至3D游戏Labyrinth,但在稀疏奖励环境中仍存在问题。在学习策略时,既难以探索,也难以利用少量成功经验。为解决这一问题,子目标与选项框架已被提出。然而,在大状态空间中在线发现子目标的代价过高,无法用于学习选项。我们提出微目标学习(Micro-Objective Learning, MOL)来解决该问题。其核心思想是在训练过程中估计某个状态的重要性,并给予与其重要性成比例的额外奖励。我们在两款Atari游戏——Montezuma's Revenge和Seaquest上评估了算法。每款游戏进行三次实验,MOL均显著提升了基线得分。尤其在Montezuma's Revenge中,MOL取得了比此前最先进模型高出两倍的成果。
引用
@article{arxiv.1703.03933,
title = {Micro-Objective Learning : Accelerating Deep Reinforcement Learning through the Discovery of Continuous Subgoals},
author = {Sungtae Lee and Sang-Woo Lee and Jinyoung Choi and Dong-Hyun Kwak and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:1703.03933},
year = {2017}
}