中文

面向策略优化的随机降维二阶方法

最优化与控制 2023-01-31 v1 机器学习

摘要

本文提出几种新的随机二阶策略优化算法,每次迭代仅需梯度与 Hessian-向量积,使其在计算上高效且与策略梯度方法相当。具体而言,我们提出一种降维二阶方法(DR-SOPO),其反复求解一个投影的二维信赖域子问题。我们证明 DR-SOPO 在达到近似一阶平稳条件及某种子空间二阶平稳条件时具有 O(ϵ3.5)\mathcal{O}(\epsilon^{-3.5}) 的复杂度。此外,我们给出一种增强算法(DVR-SOPO),基于方差缩减技术将复杂度进一步提升至 O(ϵ3)\mathcal{O}(\epsilon^{-3})。初步实验表明,我们所提算法相比随机与方差缩减策略梯度方法表现更优。

关键词

引用

@article{arxiv.2301.12174,
  title  = {Stochastic Dimension-reduced Second-order Methods for Policy Optimization},
  author = {Jinsong Liu and Chenghan Xie and Qi Deng and Dongdong Ge and Yinyu Ye},
  journal= {arXiv preprint arXiv:2301.12174},
  year   = {2023}
}