有限 MDP 下策略梯度方法的线性收敛性
机器学习
2021-12-14 v2 最优化与控制
机器学习
摘要
我们重新审视了策略梯度方法在最简设置之一下的有限时间分析:具有有限状态和动作 MDP、策略类由所有随机策略构成且进行精确梯度计算。近期有一些工作将此设置视为光滑非线性优化问题的实例,并展示了在小步长下的次线性收敛速率。此处,我们基于与策略迭代的关联采取不同视角,表明许多策略梯度方法变体在大步长下取得成功,并达到线性收敛速率。
引用
@article{arxiv.2007.11120,
title = {On Linear Convergence of Policy Gradient Methods for Finite MDPs},
author = {Jalaj Bhandari and Daniel Russo},
journal= {arXiv preprint arXiv:2007.11120},
year = {2021}
}
备注
Published in AISTATS 2021