面向策略优化的随机降维二阶方法
最优化与控制
2023-01-31 v1 机器学习
摘要
本文提出几种新的随机二阶策略优化算法,每次迭代仅需梯度与 Hessian-向量积,使其在计算上高效且与策略梯度方法相当。具体而言,我们提出一种降维二阶方法(DR-SOPO),其反复求解一个投影的二维信赖域子问题。我们证明 DR-SOPO 在达到近似一阶平稳条件及某种子空间二阶平稳条件时具有 的复杂度。此外,我们给出一种增强算法(DVR-SOPO),基于方差缩减技术将复杂度进一步提升至 。初步实验表明,我们所提算法相比随机与方差缩减策略梯度方法表现更优。
引用
@article{arxiv.2301.12174,
title = {Stochastic Dimension-reduced Second-order Methods for Policy Optimization},
author = {Jinsong Liu and Chenghan Xie and Qi Deng and Dongdong Ge and Yinyu Ye},
journal= {arXiv preprint arXiv:2301.12174},
year = {2023}
}