预测式优先经验回放:面向稳定深度强化学习的优先级与多样性平衡
机器学习
2020-11-30 v1 人工智能
摘要
优先经验回放(PER)对重要转移进行采样而非均匀采样,以提升深度强化学习智能体的性能。我们主张,为使 DQN 稳定并防止遗忘,此类优先级必须与样本多样性相平衡。我们提出的 PER 改进方法称为预测式优先经验回放(PPER),采取三项对策(TDInit、TDClip、TDPred)以(i)消除优先级离群值与爆炸,(ii)在优先级加权下改善样本多样性与分布,二者均有助于稳定 DQN。三项对策中最值得注意的是引入称为 TDPred 的第二个 DNN 以泛化分布内优先级。在 Atari 游戏上的消融研究与完整实验表明,各项对策以其自身方式以及 PPER 均有助于成功提升相对于 PER 的稳定性进而提升性能。
引用
@article{arxiv.2011.13093,
title = {Predictive PER: Balancing Priority and Diversity towards Stable Deep Reinforcement Learning},
author = {Sanghwa Lee and Jaeyoung Lee and Ichiro Hasuo},
journal= {arXiv preprint arXiv:2011.13093},
year = {2020}
}
备注
Presented at Deep Reinforcement Learning Workshop, NeurIPS 2020