中文

如何让深度强化学习在实践中有用

机器学习 2020-11-11 v2 机器人学

摘要

近年来,深度强化学习(RL)使具有挑战性的控制问题得以解决。为了能够将 RL 用于大规模现实世界应用,其性能必须具备一定程度的可靠性。最先进算法的已报道结果往往难以复现。原因之一在于某些实现细节会显著影响性能。通常,这些细节未被作为取得最先进性能的重要技术而强调。此外,来自监督学习的技术常被默认使用,但却以不同且未被充分理解的方式影响强化学习设定下的算法。本文中,我们研究了某些初始化、输入归一化和自适应学习技术对最先进 RL 算法性能的影响。我们就默认使用其中哪些技术提出建议,并指出可能受益于专门针对 RL 定制的解决方案的领域。

关键词

引用

@article{arxiv.2010.13083,
  title  = {How to Make Deep RL Work in Practice},
  author = {Nirnai Rao and Elie Aljalbout and Axel Sauer and Sami Haddadin},
  journal= {arXiv preprint arXiv:2010.13083},
  year   = {2020}
}

备注

Published as a workshop paper at the Deep RL workshop, NeurIPS 2020