中文

用于深度强化学习策略微调的直接随机搜索

机器人学 2022-03-08 v2 机器学习

摘要

研究人员已证明深度强化学习(DRL)是一种强大的工具,可用于寻找在复杂机器人系统上表现良好的策略。然而,这些策略往往不可预测,并且在仅以略微不同的初始条件进行评估时,会引发高度可变的行为。训练方面的考量限制了 DRL 算法的设计,即大多数算法在训练期间必须使用随机策略。然而,部署期间使用的最终策略可以且经常是确定性的,其在每一步使用最大似然动作(MLA)。在这项工作中,我们展示了直接随机搜索通过利用确定性滚动直接优化 DRL 策略来进行微调是非常有效的。我们在一大批强化学习环境中,使用从多种不同算法获得的各种策略说明了这一点。我们的结果表明,该方法在我们测试的环境上产生了更一致且性能更高的智能体。此外,我们展示了如何利用该方法扩展我们先前关于缩小在深度神经网络(DNN)策略下运行的闭环系统可达状态空间维度的研究工作。

关键词

引用

@article{arxiv.2109.05604,
  title  = {Direct Random Search for Fine Tuning of Deep Reinforcement Learning Policies},
  author = {Sean Gillen and Asutay Ozmen and Katie Byl},
  journal= {arXiv preprint arXiv:2109.05604},
  year   = {2022}
}

备注

Under Review