弱光滑设定下策略梯度方法的收敛性与最优性
机器学习
2022-04-08 v2 人工智能
系统与控制
系统与控制
摘要
策略梯度方法已频繁应用于控制与强化学习问题并取得巨大成功,然而现有的收敛分析仍依赖于不直观、不实用且往往不透明的条件。特别地,现有收敛速率仅在有限设定下、严格正则条件下达成。本工作中,我们建立了策略梯度方法的显式收敛速率,将收敛范畴扩展至具有 可积梯度的弱光滑策略类。我们提供直观示例以阐明这些新条件背后的洞见。值得注意的是,我们的分析还表明,在这些假设下标准策略梯度和自然策略梯度算法均可实现收敛速率。最后,我们为收敛策略提供性能保证。
引用
@article{arxiv.2111.00185,
title = {Convergence and Optimality of Policy Gradient Methods in Weakly Smooth Settings},
author = {Matthew S. Zhang and Murat A. Erdogdu and Animesh Garg},
journal= {arXiv preprint arXiv:2111.00185},
year = {2022}
}