带有二阶动量的策略梯度
机器学习
2025-05-20 v1 数值分析
数值分析
最优化与控制
摘要
我们开发了带有二阶动量的策略梯度(PG-SOM),这是一种用于强化学习策略的轻量级二阶优化方案。PG-SOM 在经典的 REINFORCE 更新基础上,增加了两个指数加权统计量:一阶梯度平均值和对角近似的海森矩阵。通过用此曲率估计对梯度进行预处理,该方法能够自适应地重新调整每个参数,从而实现更快、更稳定的期望回报上升。我们提供了简洁的推导过程,证明了在温和的正则性假设下,对角海森估计量是无偏且正定的,并证明了由此产生的更新在期望上是一个下降方向。在标准控制基准上的数值实验表明,与一阶和费舍尔矩阵基线方法相比,PG-SOM 的样本效率最高提升了 2.1 倍,且方差显著降低。这些结果表明,即使是粗略的二阶信息也能带来显著的实践增益,而对于一个 D 维参数策略,仅需 D 的内存开销。所有代码和可复现脚本将公开提供。
引用
@article{arxiv.2505.11561,
title = {Policy Gradient with Second Order Momentum},
author = {Tianyu Sun},
journal= {arXiv preprint arXiv:2505.11561},
year = {2025}
}