面向深度强化学习的可泛化情景记忆
机器学习
2021-06-14 v3 人工智能
摘要
基于情景记忆的方法可通过非参数记忆快速锁定过去成功的策略,并提升传统强化学习的样本效率。然而,在连续域中鲜有研究投入,其中状态不会被重复访问,且已有的情景方法无法跨轨迹高效聚合经验。为解决该问题,我们提出可泛化情景记忆(GEM),它以可泛化方式有效组织情景记忆中的状态-动作值,并支持对记忆轨迹的隐式规划。GEM利用双重估计器来降低规划过程中由值传播引起的过高估计偏差。实证评估表明,我们的方法在各种MuJoCo连续控制任务上显著优于已有的基于轨迹的方法。为进一步展示通用适用性,我们在具有离散动作空间的Atari游戏上评估了我们的方法,同样显示出相对于基线算法的显著提升。
引用
@article{arxiv.2103.06469,
title = {Generalizable Episodic Memory for Deep Reinforcement Learning},
author = {Hao Hu and Jianing Ye and Guangxiang Zhu and Zhizhou Ren and Chongjie Zhang},
journal= {arXiv preprint arXiv:2103.06469},
year = {2021}
}