中文

用于经验回放的清醒梦:以当前策略刷新过往状态

机器学习 2021-04-06 v3 人工智能 机器学习

摘要

经验回放(ER)通过让智能体将过往经验存储于回放缓冲区并重用,提升了离策略强化学习(RL)算法的数据效率。尽管已有诸多技术通过偏置缓冲区中经验的采样来增强 ER,但迄今尚未考虑刷新缓冲区内经验的策略。本文引入用于经验回放的清醒梦(LiDER),一种概念上全新的框架,允许利用智能体当前策略刷新回放经验。LiDER 包含三步:首先,LiDER 将智能体移回过往状态。其次,从该状态出发,LiDER 令智能体依其当前策略执行一串动作——仿佛智能体在“梦”过往,并可尝试不同行为以在梦中遭遇新经验。第三,若新经验优于智能体先前经验,LiDER 将其存储并重用,从而刷新记忆。LiDER 设计为易于融入使用 ER 的离策略、多智能体 RL 算法;本文给出将 LiDER 应用于基于 actor-critic 算法的案例研究。结果显示 LiDER 在六款 Atari 2600 游戏中持续优于基线。本工作的 LiDER 开源实现及生成所有图的数据见于 github.com/duyunshu/lucid-dreaming-for-exp-replay。

关键词

引用

@article{arxiv.2009.13736,
  title  = {Lucid Dreaming for Experience Replay: Refreshing Past States with the Current Policy},
  author = {Yunshu Du and Garrett Warnell and Assefaw Gebremedhin and Peter Stone and Matthew E. Taylor},
  journal= {arXiv preprint arXiv:2009.13736},
  year   = {2021}
}

备注

29 pages (with appendices), 8 figures, preprint