策略优化中高效逃离鞍点
机器学习
2025-10-01 v2 最优化与控制
摘要
策略梯度(PG)因其可扩展性与良好性能被广泛用于强化学习。近年来,若干方差缩减PG方法被提出,理论上保证以的样本复杂度收敛到近似一阶平稳点(FOSP)。然而,FOSP可能是糟糕的局部最优或鞍点。此外,这些算法常使用重要性采样(IS)权重,可能损害方差缩减的统计有效性。本文提出一种方差缩减二阶方法,以Hessian向量积(HVP)形式的二阶信息,以的样本复杂度收敛到近似二阶平稳点(SOSP)。该速率将已知达到近似SOSP的最佳样本复杂度提升了倍。而且,所提方差缩减技术通过使用HVP项绕开了IS权重。实验结果表明,所提算法优于最先进水平,且对随机种子变化更具鲁棒性。
引用
@article{arxiv.2311.08914,
title = {Efficiently Escaping Saddle Points for Policy Optimization},
author = {Sadegh Khorasani and Saber Salehkaleybar and Negar Kiyavash and Niao He and Matthias Grossglauser},
journal= {arXiv preprint arXiv:2311.08914},
year = {2025}
}
备注
arXiv admin note: text overlap with arXiv:2205.08253