基于模型的强化学习基准测试
机器学习
2019-07-04 v1 人工智能
机器人学
机器学习
摘要
基于模型的强化学习(MBRL)被广泛认为有潜力比无模型 RL 显著更高效采样。然而,MBRL 的研究尚未非常标准化。作者用自行设计的环境做实验相当常见,并且存在若干独立的研究路线,有时是闭源或不可复现的。因此,这些各式各样的现有 MBRL 算法相互之间的性能如何是一个开放问题。为促进 MBRL 研究,本文收集了广泛的 MBRL 算法并提出了专为 MBRL 设计的超过 18 个基准测试环境。我们以统一的问题设定(包括含噪环境)对这些算法进行基准测试。除罗列性能外,我们探索并统一了各 MBRL 算法背后的算法差异。我们刻画了未来 MBRL 研究的三大关键挑战:动力学瓶颈、规划时域困境与提前终止困境。最后,为最大程度促进未来 MBRL 研究,我们在 http://www.cs.toronto.edu/~tingwuwang/mbrl.html 开源了我们的基准。
引用
@article{arxiv.1907.02057,
title = {Benchmarking Model-Based Reinforcement Learning},
author = {Tingwu Wang and Xuchan Bao and Ignasi Clavera and Jerrick Hoang and Yeming Wen and Eric Langlois and Shunshi Zhang and Guodong Zhang and Pieter Abbeel and Jimmy Ba},
journal= {arXiv preprint arXiv:1907.02057},
year = {2019}
}
备注
8 main pages, 8 figures; 14 appendix pages, 25 figures