AlphaGrad:非线性梯度归一化优化器
机器学习
2025-04-24 v2 人工智能
神经与进化计算
机器学习
摘要
我们提出 AlphaGrad,这是一种 memory-efficient、条件无状态的优化器,解决 Adam 等自适应方法的 memory 开销和 hyperparameter 复杂度问题。AlphaGrad 通过张量级 L2 梯度归一化,随后进行平滑的双曲正切变换 实现尺度不变性,变换由单个锐度参数 控制。我们的贡献包括:(1) AlphaGrad 算法的形式化;(2) 形式的非凸收敛性分析,保证平稳性;(3) 在多样化 RL 基准测试 (DQN、TD3、PPO) 上的广泛实证评估。与 Adam 相比,AlphaGrad 显示出高度依赖情境的性能轮廓。虽然在 off-policy DQN 中表现出不稳定,但在 TD3 (需要谨慎 调整) 中提供训练稳定性并取得竞争成绩,在 on-policy PPO 中实现显著优异的性能。这些结果凸显了选择 的关键性,揭示了优化器动力学与底层 RL 算法之间的强烈相互作用。AlphaGrad 为 memory-constrained 场景提供了引人注目的备选优化器,在其稳定性和效率优势尤其有利的 on-policy 学习场景中展现出显著的前景。
引用
@article{arxiv.2504.16020,
title = {AlphaGrad: Non-Linear Gradient Normalization Optimizer},
author = {Soham Sane},
journal= {arXiv preprint arXiv:2504.16020},
year = {2025}
}