AM-PPO:基于优势Alpha调制的近端策略优化
机器学习
2025-05-22 v1 人工智能
神经与进化计算
摘要
近端策略优化(PPO)是一种广泛使用的强化学习算法,其高度依赖准确的优势估计以实现稳定高效的训练。然而,原始优势信号可能表现出显著的方差、噪声和尺度相关问题,阻碍最优学习性能。为应对这一挑战,我们提出了优势调制PPO(AM-PPO),这是一种PPO的新增强方法,通过动态非线性缩放机制自适应地调制优势估计。这种自适应调制采用alpha控制器,根据优势信号的演化统计特性(如其范数、方差和预定义的饱和目标水平)动态调整缩放因子。通过引入由这些自适应缩放优势驱动的基于tanh的门控函数,AM-PPO重塑优势信号以稳定梯度更新并改善策略梯度景观的条件性。关键的是,这种调制还通过提供一致且自适应调节的学习目标来影响价值函数训练。在标准连续控制基准上的经验评估表明,AM-PPO实现了更优的奖励轨迹,表现出持续的学习进展,并显著减少了自适应优化器所需的裁剪。这些发现强调了优势调制作为一种广泛适用的技术来增强强化学习优化的潜力。
引用
@article{arxiv.2505.15514,
title = {AM-PPO: (Advantage) Alpha-Modulation with Proximal Policy Optimization},
author = {Soham Sane},
journal= {arXiv preprint arXiv:2505.15514},
year = {2025}
}
备注
17 pages, 4 Tables, 9 Figures, 11 equations