中文

通过相似转移集合建模改进经验回放

机器学习 2021-11-16 v1

摘要

在这项工作中,我们提出并评估了一种新的强化学习方法——紧凑经验回放(COMPact Experience Replay,COMPER),该方法利用基于相似转移集合递归的预测目标值进行时序差分学习,并采用了一种基于两个转移记忆的经验回放新方案。我们的目标是在长期总累积奖励方面,减少智能体训练所需的经验数量。它与强化学习的相关性在于,其仅需少量观测即可取得与文献中相关方法相近的结果,而后者通常需要在 Atari 2600 游戏上训练智能体数百万视频帧。我们报告了 COMPER 在街机学习环境(Arcade Learning Environment,ALE)的八个具有挑战性游戏上、仅用 100,000 帧和约 25,000 次迭代及小型经验记忆进行的五次训练试验的详细结果。我们还给出了在相同游戏集上采用相同实验协议的 DQN 智能体作为基线的结果。为验证 COMPER 从较少观测中逼近良好策略的性能,我们还将其结果与 ALE 基准中数百万帧所呈现的结果进行了比较。

关键词

引用

@article{arxiv.2111.06907,
  title  = {Improving Experience Replay through Modeling of Similar Transitions' Sets},
  author = {Daniel Eugênio Neves and João Pedro Oliveira Batisteli and Eduardo Felipe Lopes and Lucila Ishitani and Zenilton Kleber Gonçalves do Patrocínio Júnior},
  journal= {arXiv preprint arXiv:2111.06907},
  year   = {2021}
}

备注

41 pages