中文

基于模型的强化学习基准测试

机器学习 2019-07-04 v1 人工智能 机器人学 机器学习

摘要

基于模型的强化学习(MBRL)被广泛认为有潜力比无模型 RL 显著更高效采样。然而,MBRL 的研究尚未非常标准化。作者用自行设计的环境做实验相当常见,并且存在若干独立的研究路线,有时是闭源或不可复现的。因此,这些各式各样的现有 MBRL 算法相互之间的性能如何是一个开放问题。为促进 MBRL 研究,本文收集了广泛的 MBRL 算法并提出了专为 MBRL 设计的超过 18 个基准测试环境。我们以统一的问题设定(包括含噪环境)对这些算法进行基准测试。除罗列性能外,我们探索并统一了各 MBRL 算法背后的算法差异。我们刻画了未来 MBRL 研究的三大关键挑战:动力学瓶颈、规划时域困境与提前终止困境。最后,为最大程度促进未来 MBRL 研究,我们在 http://www.cs.toronto.edu/~tingwuwang/mbrl.html 开源了我们的基准。

关键词

引用

@article{arxiv.1907.02057,
  title  = {Benchmarking Model-Based Reinforcement Learning},
  author = {Tingwu Wang and Xuchan Bao and Ignasi Clavera and Jerrick Hoang and Yeming Wen and Eric Langlois and Shunshi Zhang and Guodong Zhang and Pieter Abbeel and Jimmy Ba},
  journal= {arXiv preprint arXiv:1907.02057},
  year   = {2019}
}

备注

8 main pages, 8 figures; 14 appendix pages, 25 figures