中文

REINFORCE 策略梯度估计中的非均匀噪声-信号比

最优化与控制 2026-02-10 v2 机器学习

摘要

策略梯度方法在强化学习中广泛应用,但随着学习进行,训练往往变得不稳定或减缓。我们通过策略梯度估计的噪声-信号比 (NSR) 来研究这一现象,后者定义为策略梯度估计的方差 (噪声) 归一化后的真实梯度的平方范数 (信号)。我们的主要结果表明,对于 (i) 具有高斯策略和线性状态反馈的有限时序线性系统,以及 (ii) 具有高斯策略和多项式反馈的有限时序多项式系统,REINFORCE 估计的 NSR 可**准确**地**以闭式或无近似的数值矩求值算法**表征。对于一般非线性动力学和表达性策略(包括神经网络策略),我们进一步推导了方差的通用上界。这些表征使我们能够直接检验 NSR 如何随策略参数变化以及如何沿优化轨迹(如 SGD 和 Adam)演化。在一系列示例中,我们发现 NSR 区域是高度非均匀的,通常在策略接近最优时会增加;在某些情况下会发散,这可能触发训练不稳定和策略崩溃。

关键词

引用

@article{arxiv.2602.01460,
  title  = {Non-Uniform Noise-to-Signal Ratio in the REINFORCE Policy-Gradient Estimator},
  author = {Haoyu Han and Heng Yang},
  journal= {arXiv preprint arXiv:2602.01460},
  year   = {2026}
}