中文

弱光滑设定下策略梯度方法的收敛性与最优性

机器学习 2022-04-08 v2 人工智能 系统与控制 系统与控制

摘要

策略梯度方法已频繁应用于控制与强化学习问题并取得巨大成功,然而现有的收敛分析仍依赖于不直观、不实用且往往不透明的条件。特别地,现有收敛速率仅在有限设定下、严格正则条件下达成。本工作中,我们建立了策略梯度方法的显式收敛速率,将收敛范畴扩展至具有 L2L_2 可积梯度的弱光滑策略类。我们提供直观示例以阐明这些新条件背后的洞见。值得注意的是,我们的分析还表明,在这些假设下标准策略梯度和自然策略梯度算法均可实现收敛速率。最后,我们为收敛策略提供性能保证。

关键词

引用

@article{arxiv.2111.00185,
  title  = {Convergence and Optimality of Policy Gradient Methods in Weakly Smooth Settings},
  author = {Matthew S. Zhang and Murat A. Erdogdu and Animesh Garg},
  journal= {arXiv preprint arXiv:2111.00185},
  year   = {2022}
}