中文

我的最优解去哪了?:策略梯度方法中梯度下降优化的实证分析

机器学习 2018-10-08 v1 人工智能 机器学习

摘要

近期对某些梯度下降优化方法的分析表明,性能在若干设定下会退化——例如存在随机性或隐式动量时。在深度强化学习(Deep RL)中,此类优化方法常通过时序差分误差或策略梯度训练神经网络。随着智能体随时间改进,优化目标发生变化,从而损失地形(及局部最优)改变。由于这些方法的失效模式,Deep RL 的理想优化器选择仍不明确。为此,我们针对一系列基准连续控制任务,广泛实证分析了多种梯度下降优化器及其超参数对策略梯度方法(Deep RL 算法的一个子集)的影响。我们发现自适应优化器的有效学习率窗口狭窄,其他情形则发散,且动量的有效性随环境特性而异。我们的分析表明,环境动态与 Deep RL 算法特性之间存在传统自适应梯度方法未必能顾及的显著相互作用。我们基于发现给出了当前方法的最优设置建议及后续研究方向。

关键词

引用

@article{arxiv.1810.02525,
  title  = {Where Did My Optimum Go?: An Empirical Analysis of Gradient Descent Optimization in Policy Gradient Methods},
  author = {Peter Henderson and Joshua Romoff and Joelle Pineau},
  journal= {arXiv preprint arXiv:1810.02525},
  year   = {2018}
}

备注

Accepted at the European Workshop on Reinforcement Learning 2018 (EWRL14)