通过相似转移集合建模改进经验回放
机器学习
2021-11-16 v1
摘要
在这项工作中,我们提出并评估了一种新的强化学习方法——紧凑经验回放(COMPact Experience Replay,COMPER),该方法利用基于相似转移集合递归的预测目标值进行时序差分学习,并采用了一种基于两个转移记忆的经验回放新方案。我们的目标是在长期总累积奖励方面,减少智能体训练所需的经验数量。它与强化学习的相关性在于,其仅需少量观测即可取得与文献中相关方法相近的结果,而后者通常需要在 Atari 2600 游戏上训练智能体数百万视频帧。我们报告了 COMPER 在街机学习环境(Arcade Learning Environment,ALE)的八个具有挑战性游戏上、仅用 100,000 帧和约 25,000 次迭代及小型经验记忆进行的五次训练试验的详细结果。我们还给出了在相同游戏集上采用相同实验协议的 DQN 智能体作为基线的结果。为验证 COMPER 从较少观测中逼近良好策略的性能,我们还将其结果与 ALE 基准中数百万帧所呈现的结果进行了比较。
引用
@article{arxiv.2111.06907,
title = {Improving Experience Replay through Modeling of Similar Transitions' Sets},
author = {Daniel Eugênio Neves and João Pedro Oliveira Batisteli and Eduardo Felipe Lopes and Lucila Ishitani and Zenilton Kleber Gonçalves do Patrocínio Júnior},
journal= {arXiv preprint arXiv:2111.06907},
year = {2021}
}
备注
41 pages