中文

双优先级状态回收经验回放

机器学习 2021-12-13 v3 机器学习

摘要

经验回放使在线强化学习智能体能够存储并复用与环境交互的先前经验。在原始方法中,经验以均匀随机方式采样与回放。已有称为优先级经验回放的前期工作,其对经验赋予优先级,从而更频繁地回放看似更重要的经验。本文中,我们提出一种称为双优先级状态回收(DPSR)经验回放的方法,在训练阶段与存储阶段均对经验排序,并通过状态回收以替换内存中经验,从而充分利用那些暂时看似低优先级的经验。我们将该方法用于深度 Q 网络(DQN),取得了最先进的结果,在许多 Atari 游戏上优于原始方法与优先级经验回放。

关键词

引用

@article{arxiv.2007.03961,
  title  = {Double Prioritized State Recycled Experience Replay},
  author = {Fanchen Bu and Dong Eui Chang},
  journal= {arXiv preprint arXiv:2007.03961},
  year   = {2021}
}