神经策略梯度方法:全局最优性与收敛速率
机器学习
2020-06-23 v3 最优化与控制
机器学习
摘要
带有 actor-critic 方案的策略梯度方法展现了巨大的实证成功,尤其是当 actor 和 critic 由神经网络参数化时。然而,此类“神经”策略梯度方法是否会收敛到全局最优策略、甚至是否会收敛,仍不甚明确。我们在过参数化 regime 下对这两个问题均给出了肯定的回答。具体而言,我们证明了神经自然策略梯度以亚线性速率收敛到全局最优策略。同时,我们展示了神经原始策略梯度以亚线性速率收敛到驻点。此外,通过将驻点的次优性与神经 actor 和 critic 类的表示能力相关联,我们在温和正则条件下证明了所有驻点的全局最优性。特别地,我们表明实现全局最优性与收敛的一个关键在于 actor 与 critic 之间的“兼容性”,这通过 actor 与 critic 共享神经架构和随机初始化来保证。据我们所知,我们的分析首次建立了神经策略梯度方法的全局最优性与收敛保证。
引用
@article{arxiv.1909.01150,
title = {Neural Policy Gradient Methods: Global Optimality and Rates of Convergence},
author = {Lingxiao Wang and Qi Cai and Zhuoran Yang and Zhaoran Wang},
journal= {arXiv preprint arXiv:1909.01150},
year = {2020}
}
备注
71 pages. The first two authors contribute equally