中文

大批量经验回放

机器学习 2022-06-15 v2

摘要

已有若干算法被提出以非均匀采样深度强化学习(RL)智能体的经验回放缓冲以加速学习,但这些采样方案的理论基础极少。其中,优先经验回放(Prioritized Experience Replay)表现为对超参数敏感的启发式方法,尽管其可提供良好性能。本工作中,我们将回放缓冲采样问题视为估计梯度的重要性采样问题。这允许推导出理论最优采样分布,产生最佳理论收敛速度。基于理想采样方案的认识,我们阐明了优先经验回放的新理论基础。由于最优采样分布难以处理,我们作出若干近似,在实践中提供良好结果,并引入其中包括 LaBER(Large Batch Experience Replay,大批量经验回放)这一易于编码且高效的回放缓冲采样方法。LaBER 可与 Deep Q-Networks、分布式 RL 智能体或 actor-critic 方法结合,在多种 Atari 游戏与 PyBullet 环境中相较其所基于的基础智能体及其他优先级方案均取得改进性能。

关键词

引用

@article{arxiv.2110.01528,
  title  = {Large Batch Experience Replay},
  author = {Thibault Lahire and Matthieu Geist and Emmanuel Rachelson},
  journal= {arXiv preprint arXiv:2110.01528},
  year   = {2022}
}

备注

24 pages, 12 figures, ICML 2022 - long presentation