基于动量的策略梯度的全局最优收敛性
机器学习
2022-05-24 v3 最优化与控制
摘要
策略梯度(PG)方法因其相对稳定性与增量特性,在大规模强化学习中流行且高效。近年来,PG 方法的经验成功促成了这些方法理论基础的发展。本工作中,我们推广了这一研究方向,研究带有动量项的随机 PG 方法的全局收敛性,动量项已被证明是改进 PG 方法的有效技巧。我们研究了 soft-max 与 Fisher-非退化策略参数化,并证明添加动量分别将朴素 PG 方法的全局最优样本复杂度改进了 与 ,其中 为目标容差。我们的工作是首个获得基于动量的 PG 方法全局收敛结果的工作。对于一般的 Fisher-非退化策略参数化,我们的结果是首个达到 全局最优样本复杂度的单循环、有限批量 PG 算法。最后,作为副产品,我们的方法还提供了分析随机 PG 方法全局收敛速率的一般框架,可容易地应用并扩展到不同的 PG 估计量。
引用
@article{arxiv.2110.10116,
title = {On the Global Optimum Convergence of Momentum-based Policy Gradient},
author = {Yuhao Ding and Junzi Zhang and Javad Lavaei},
journal= {arXiv preprint arXiv:2110.10116},
year = {2022}
}
备注
AISTATS 2022