中文

具有共享经验回放的离策略 Actor-Critic

机器学习 2019-11-19 v2 人工智能 机器学习

摘要

我们研究将 actor-critic 强化学习算法与均匀大规模经验回放相结合,并针对两个挑战提出解决方案:(a) 利用经验回放进行高效 actor-critic 学习;(b) 智能体从其他智能体行为中学习的离策略学习的稳定性。我们运用这些见解来加速超参数扫描,其中所有参与智能体并发运行并通过公共回放模块共享其经验。为此,我们分析了 V-trace(一种用于 actor-critic 方法的重要性采样形式)中的偏差-方差权衡。基于我们的分析,我们主张将回放采样的经验与同策略经验相混合,并提出一种新的信任域方案,该方案可有效扩展到 V-trace 变得不稳定的数据分布。我们提供了对所提方案的广泛实证验证。我们进一步通过展示在 Atari 上截至 2 亿环境帧训练的智能体中具有最先进的数据效率,说明了该设置的优势。

关键词

引用

@article{arxiv.1909.11583,
  title  = {Off-Policy Actor-Critic with Shared Experience Replay},
  author = {Simon Schmitt and Matteo Hessel and Karen Simonyan},
  journal= {arXiv preprint arXiv:1909.11583},
  year   = {2019}
}