中文

策略优化中高效逃离鞍点

机器学习 2025-10-01 v2 最优化与控制

摘要

策略梯度(PG)因其可扩展性与良好性能被广泛用于强化学习。近年来,若干方差缩减PG方法被提出,理论上保证以O(ϵ3)O(\epsilon^{-3})的样本复杂度收敛到近似一阶平稳点(FOSP)。然而,FOSP可能是糟糕的局部最优或鞍点。此外,这些算法常使用重要性采样(IS)权重,可能损害方差缩减的统计有效性。本文提出一种方差缩减二阶方法,以Hessian向量积(HVP)形式的二阶信息,以O~(ϵ3)\tilde{O}(\epsilon^{-3})的样本复杂度收敛到近似二阶平稳点(SOSP)。该速率将已知达到近似SOSP的最佳样本复杂度提升了O(ϵ0.5)O(\epsilon^{-0.5})倍。而且,所提方差缩减技术通过使用HVP项绕开了IS权重。实验结果表明,所提算法优于最先进水平,且对随机种子变化更具鲁棒性。

关键词

引用

@article{arxiv.2311.08914,
  title  = {Efficiently Escaping Saddle Points for Policy Optimization},
  author = {Sadegh Khorasani and Saber Salehkaleybar and Negar Kiyavash and Niao He and Matthias Grossglauser},
  journal= {arXiv preprint arXiv:2311.08914},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2205.08253