连续控制基准深度强化学习任务的可复现性
机器学习
2017-08-15 v1
摘要
强化学习中的策略梯度方法在连续控制任务的最新性能中变得越来越普遍。新方法通常以少数关键算法(如深度确定性策略梯度和信任域策略优化)作为基准进行对比。因此,展示和使用一致的基准实验非常重要。然而,由于算法的普遍方差、超参数调优和环境的随机性,这可能很困难。我们调查并讨论了:连续控制策略梯度中超参数的重要性、算法的普遍方差以及报告结果的可复现性。我们提供了关于报告新结果的指南,即作为与基线方法的比较,以便未来的研究者在研究新方法时能够做出明智的决定。
引用
@article{arxiv.1708.04133,
title = {Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control},
author = {Riashat Islam and Peter Henderson and Maziar Gomrokchi and Doina Precup},
journal= {arXiv preprint arXiv:1708.04133},
year = {2017}
}
备注
Accepted to Reproducibility in Machine Learning Workshop, ICML'17