RL Unplugged:面向离线强化学习的一组基准套件
机器学习
2021-02-18 v4 机器学习
摘要
离线强化学习方法有潜力帮助弥合强化学习研究与现实应用之间的差距。它们使得从离线数据集学习策略成为可能,从而克服现实世界中在线数据收集所带来的成本、安全性或伦理等方面的担忧。在本文中,我们提出一个名为RL Unplugged的基准,用于评估和比较离线RL方法。RL Unplugged包含来自多种领域的数据,包括游戏(如Atari基准)和模拟运动控制问题(如DM Control Suite)。这些数据集涵盖部分或可完全观测、使用连续或离散动作、以及具有随机或确定性动力学的领域。我们为RL Unplugged中的每个领域提出了详细的评估协议,并利用这些协议对监督学习与离线RL方法进行了广泛分析。我们将发布所有任务的数据并开源本文提出的所有算法。我们希望我们的基准套件能提高实验的可复现性,并使在有限计算预算下研究具有挑战性的任务成为可能,从而让RL研究在整个社区中更系统化且更易获取。展望未来,我们将RL Unplugged视为一个活的基准套件,将随研究社区和我们自身贡献的数据集而演进和增长。我们的项目页面位于 https://git.io/JJUhd。
引用
@article{arxiv.2006.13888,
title = {RL Unplugged: A Suite of Benchmarks for Offline Reinforcement Learning},
author = {Caglar Gulcehre and Ziyu Wang and Alexander Novikov and Tom Le Paine and Sergio Gomez Colmenarejo and Konrad Zolna and Rishabh Agarwal and Josh Merel and Daniel Mankowitz and Cosmin Paduraru and Gabriel Dulac-Arnold and Jerry Li and Mohammad Norouzi and Matt Hoffman and Ofir Nachum and George Tucker and Nicolas Heess and Nando de Freitas},
journal= {arXiv preprint arXiv:2006.13888},
year = {2021}
}
备注
NeurIPS paper. 21 pages including supplementary material, the github link for the datasets: https://github.com/deepmind/deepmind-research/rl_unplugged