中文

rlpyt:基于PyTorch的深度强化学习研究代码库

机器学习 2019-09-25 v2 人工智能

摘要

自深度强化学习近期在游戏博弈和模拟机器人控制中问世以来,大量新算法应运而生。其中大多为无模型算法,可分为三类:深度Q学习、策略梯度和Q值策略梯度。这些算法沿各自独立的研究路线发展,以至于几乎没有(即便有也极少)代码库同时包含这三种类型。然而这些算法共享大量通用的深度强化学习机制。我们很高兴分享rlpyt,它在共享的、优化过的基础设施之上于单一代码库中实现了全部三类算法族。它使用领先的深度学习库PyTorch,以Python模块化地实现了许多常见的深度RL算法。rlpyt被设计为一个面向中小规模深度RL研究的高吞吐代码库。本白皮书总结了其特征、已实现的算法以及与先前工作的关系,并以详细的实现和使用说明作结。rlpyt可在https://github.com/astooke/rlpyt获取。

关键词

引用

@article{arxiv.1909.01500,
  title  = {rlpyt: A Research Code Base for Deep Reinforcement Learning in PyTorch},
  author = {Adam Stooke and Pieter Abbeel},
  journal= {arXiv preprint arXiv:1909.01500},
  year   = {2019}
}

备注

v2: Updated learning curves for SAC and TD3, improved by bootstrapping value-function when trajectory ends due to time limit, and switching to newer SAC version, now referenced