具有共享经验回放的离策略 Actor-Critic
机器学习
2019-11-19 v2 人工智能
机器学习
摘要
我们研究将 actor-critic 强化学习算法与均匀大规模经验回放相结合,并针对两个挑战提出解决方案:(a) 利用经验回放进行高效 actor-critic 学习;(b) 智能体从其他智能体行为中学习的离策略学习的稳定性。我们运用这些见解来加速超参数扫描,其中所有参与智能体并发运行并通过公共回放模块共享其经验。为此,我们分析了 V-trace(一种用于 actor-critic 方法的重要性采样形式)中的偏差-方差权衡。基于我们的分析,我们主张将回放采样的经验与同策略经验相混合,并提出一种新的信任域方案,该方案可有效扩展到 V-trace 变得不稳定的数据分布。我们提供了对所提方案的广泛实证验证。我们进一步通过展示在 Atari 上截至 2 亿环境帧训练的智能体中具有最先进的数据效率,说明了该设置的优势。
引用
@article{arxiv.1909.11583,
title = {Off-Policy Actor-Critic with Shared Experience Replay},
author = {Simon Schmitt and Matteo Hessel and Karen Simonyan},
journal= {arXiv preprint arXiv:1909.11583},
year = {2019}
}