中文

基于动量的策略梯度的全局最优收敛性

机器学习 2022-05-24 v3 最优化与控制

摘要

策略梯度(PG)方法因其相对稳定性与增量特性,在大规模强化学习中流行且高效。近年来,PG 方法的经验成功促成了这些方法理论基础的发展。本工作中,我们推广了这一研究方向,研究带有动量项的随机 PG 方法的全局收敛性,动量项已被证明是改进 PG 方法的有效技巧。我们研究了 soft-max 与 Fisher-非退化策略参数化,并证明添加动量分别将朴素 PG 方法的全局最优样本复杂度改进了 O~(ϵ1.5)\tilde{\mathcal{O}}(\epsilon^{-1.5})O~(ϵ1)\tilde{\mathcal{O}}(\epsilon^{-1}),其中 ϵ>0\epsilon>0 为目标容差。我们的工作是首个获得基于动量的 PG 方法全局收敛结果的工作。对于一般的 Fisher-非退化策略参数化,我们的结果是首个达到 O~(ϵ3)\tilde{O}(\epsilon^{-3}) 全局最优样本复杂度的单循环、有限批量 PG 算法。最后,作为副产品,我们的方法还提供了分析随机 PG 方法全局收敛速率的一般框架,可容易地应用并扩展到不同的 PG 估计量。

关键词

引用

@article{arxiv.2110.10116,
  title  = {On the Global Optimum Convergence of Momentum-based Policy Gradient},
  author = {Yuhao Ding and Junzi Zhang and Javad Lavaei},
  journal= {arXiv preprint arXiv:2110.10116},
  year   = {2022}
}

备注

AISTATS 2022