中文

高通量同步深度强化学习

机器学习 2020-12-18 v1 人工智能

摘要

深度强化学习(RL)计算需求高,需要处理大量数据点。同步方法享有训练稳定性,但数据吞吐量较低。相比之下,异步方法实现了高吞吐量,但由于“陈旧策略”而存在稳定性问题和较低的样本效率。为结合两种方法的优势,我们提出了高通量同步深度强化学习(HTS-RL)。在 HTS-RL 中,我们并发地执行学习和 rollout,设计了一种避免“陈旧策略”的系统架构,并确保 actor 以异步方式与环境副本交互,同时保持完全确定性。我们在 Atari 游戏和 Google Research Football 环境中评估了我们的方法。与同步基线相比,HTS-RL 快 2-6×\times。与最先进的异步方法相比,HTS-RL 具有有竞争力的吞吐量,并始终实现更高的平均回合奖励。

关键词

引用

@article{arxiv.2012.09849,
  title  = {High-Throughput Synchronous Deep RL},
  author = {Iou-Jen Liu and Raymond A. Yeh and Alexander G. Schwing},
  journal= {arXiv preprint arXiv:2012.09849},
  year   = {2020}
}

备注

Accepted to NeurIPS 2020; Project page: https://ioujenliu.github.io/HTS-RL/