中文

经验回放缓冲中利用局部与全局上下文的学习采样方法

机器学习 2021-04-08 v2 机器学习

摘要

经验回放使智能体能够记住并复用过去的经验,在离策略强化学习(RL)的成功中发挥了重要作用。为高效利用经验回放,现有采样方法通过基于某些度量(如 TD-error)为经验赋予优先级,从而选出更有意义的经验。然而,由于它们独立计算每个转移的采样率而未考虑其相对于其他转移的重要性,可能导致采样出高度偏置、冗余的转移。本文旨在解决该问题,提出一种新的基于学习的采样方法,能够计算转移的相对重要性。为此,我们设计了一种新颖的置换等变神经架构,其输入不仅包含每个转移的特征(局部)上下文,还包含其他转移的特征(全局)上下文。我们在连续与离散控制任务的多个基准任务上验证了我们的框架(称为 Neural Experience Replay Sampler (NERS)),结果表明其能显著提升多种离策略 RL 方法的性能。进一步分析证实,采样效率的提升确实源于 NERS 考虑局部与全局上下文从而采样出多样且有意义的转移。

关键词

引用

@article{arxiv.2007.07358,
  title  = {Learning to Sample with Local and Global Contexts in Experience Replay Buffer},
  author = {Youngmin Oh and Kimin Lee and Jinwoo Shin and Eunho Yang and Sung Ju Hwang},
  journal= {arXiv preprint arXiv:2007.07358},
  year   = {2021}
}