Tonic:一个用于快速原型设计与基准测试的深度强化学习库
机器学习
2021-05-20 v2
摘要
深度强化学习在过去几年中是机器学习发展最快的领域之一,已有众多开源库用于支撑研究。然而,大多数代码库学习曲线陡峭或灵活性有限,无法满足基础研究中快速原型设计的需求。本文介绍Tonic,一个允许研究者借助以下特性快速实现新想法并衡量其重要性的Python库:1) 通用可配置模块;2) 使用这些模块构建的若干基线智能体:A2C、TRPO、PPO、MPO、DDPG、D4PG、TD3与SAC;3) 对TensorFlow 2与PyTorch的支持;4) 对来自OpenAI Gym、DeepMind Control Suite与PyBullet的连续控制环境的支持;5) 以可复现方式实验、绘制结果并与训练后智能体交互的脚本;6) 所提供的智能体在70个连续控制任务上的基准测试。评估在公平条件下进行,使用相同随机种子、训练与测试循环,同时共享如非终止超时与观测归一化等通用改进。最后,为展示Tonic如何简化实验,我们实现并评估了一个名为TD4的新型智能体。
引用
@article{arxiv.2011.07537,
title = {Tonic: A Deep Reinforcement Learning Library for Fast Prototyping and Benchmarking},
author = {Fabio Pardo},
journal= {arXiv preprint arXiv:2011.07537},
year = {2021}
}
备注
Code: https://github.com/fabiopardo/tonic