IMPACT:基于截断重要性采样与裁剪目标网络的重要性加权异步架构
机器学习
2020-01-24 v3 机器学习
摘要
强化学习智能体的实际使用常受训练时长的瓶颈限制。为加速训练,实践者常转向分布式强化学习架构以并行和加速训练过程。然而,现代可扩展强化学习(RL)方法往往在 RL 智能体可学习的样本吞吐量与该智能体从每样本学习的质量(样本效率)之间做权衡。在这些可扩展 RL 架构中,随着样本吞吐量增加(即 IMPALA 中并行度提高),样本效率显著下降。为此,我们提出一种新的分布式强化学习算法 IMPACT。IMPACT 在 IMPALA 基础上做了三处改动:用于稳定替代目标的目标网络、环形缓冲区和截断重要性采样。在离散动作空间环境中,我们表明 IMPACT 获得了更高奖励,同时训练墙钟时间比 IMPALA 减少达 30%。对于连续控制环境,IMPACT 比现有可扩展智能体训练更快,同时保持了同步 PPO 的样本效率。
引用
@article{arxiv.1912.00167,
title = {IMPACT: Importance Weighted Asynchronous Architectures with Clipped Target Networks},
author = {Michael Luo and Jiahao Yao and Richard Liaw and Eric Liang and Ion Stoica},
journal= {arXiv preprint arXiv:1912.00167},
year = {2020}
}
备注
ICLR 2020 Publication; 14 pages, 10 figures