中文

基于动量的策略梯度方法

机器学习 2020-08-07 v2 机器人学 系统与控制 系统与控制 最优化与控制 机器学习

摘要

在本文中,我们提出了一类高效的基于动量的策略梯度方法用于无模型强化学习,其使用自适应学习率且不需要任何大批量数据。具体地,我们基于一种新的基于动量的方差缩减技术与重要性采样技术,提出了一种快速重要性采样基于动量的策略梯度(IS-MBPG)方法。我们还基于基于动量的方差缩减技术与海森辅助技术,提出了一种快速海森辅助基于动量的策略梯度(HA-MBPG)方法。此外,我们证明了 IS-MBPG 与 HA-MBPG 方法均达到了寻找非凹性能函数的 ϵ\epsilon-平稳点的最佳已知样本复杂度 O(ϵ3)O(\epsilon^{-3}),且每次迭代仅需一条轨迹。特别地,我们给出了 IS-MBPG 方法的非自适应版本,即 IS-MBPG*,其同样在不使用任何大批量数据的情况下达到了最佳已知样本复杂度 O(ϵ3)O(\epsilon^{-3})。在实验中,我们应用四个基准任务来证明我们算法的有效性。

关键词

引用

@article{arxiv.2007.06680,
  title  = {Momentum-Based Policy Gradient Methods},
  author = {Feihu Huang and Shangqian Gao and Jian Pei and Heng Huang},
  journal= {arXiv preprint arXiv:2007.06680},
  year   = {2020}
}

备注

ICML 2020, 24 pages