中文

策略梯度寻找二阶平稳点的样本复杂度

机器学习 2020-12-04 v1

摘要

基于策略的强化学习(RL)的目标是搜索其目标函数的最大值点。然而,由于其目标函数固有的非凹性,收敛到一阶平稳点(FOSP)无法保证策略梯度方法找到最大值点。FOSP 可能是极小点甚至是鞍点,这对于 RL 是不可取的。幸运的是,如果所有鞍点都是严格的,则所有二阶平稳点(SOSP)恰好等价于局部极大值。我们考虑以 SOSP 而非 FOSP 作为收敛准则来刻画策略梯度的样本复杂度。我们的结果表明,策略梯度在经过总成本 O(ϵ92(1γ)χlog1δ)\mathcal{O}\left(\dfrac{\epsilon^{-\frac{9}{2}}}{(1-\gamma)\sqrt\chi}\log\dfrac{1}{\delta}\right) 后,以至少 1O~(δ)1-\widetilde{\mathcal{O}}(\delta) 的概率收敛到 (ϵ,ϵχ)(\epsilon,\sqrt{\epsilon\chi})-SOSP,其中 γ(0,1)\gamma\in(0,1)。我们的结果显著改进了现有最优结果,后者需要 O(ϵ9χ32δlog1ϵχ)\mathcal{O}\left(\dfrac{\epsilon^{-9}\chi^{\frac{3}{2}}}{\delta}\log\dfrac{1}{\epsilon\chi}\right)。我们的分析基于一个关键思想,即将参数空间 Rp\mathbb{R}^p 分解为三个互不相交的区域:非平稳点、鞍点和局部最优区域,然后在每个区域中对 RL 的目标函数进行局部改进。该技术有潜力推广到广泛的策略梯度方法。

关键词

引用

@article{arxiv.2012.01491,
  title  = {Sample Complexity of Policy Gradient Finding Second-Order Stationary Points},
  author = {Long Yang and Qian Zheng and Gang Pan},
  journal= {arXiv preprint arXiv:2012.01491},
  year   = {2020}
}

备注

This submission has been accepted by AAAI2021