SoftSignSGD(S3):一种超越 Adam 的 DNN 训练优化器与损失尖峰最小化工具
机器学习
2025-07-10 v1 人工智能
摘要
Adam 在训练深度神经网络方面取得了显著成功,但其经验成功与局限性的内在机制仍未得到充分探索。在本研究中,我们表明 Adam 的有效性主要源于其类似 SignSGD 能够稳健处理大幅梯度波动,然而它也因更新规模不可控而易受损失尖峰的破坏。为弥补 Adam 的优势并缓解其局限性,我们提出了 SignSoftSGD(S3),这是一种新型优化器,具有三个关键创新。第一,S3 通过在分母中采用灵活的 p 次序动量(p≥1),推广了类似符号的更新,超越了常规二阶动量(方差)预条件化的传统做法。这一设计既提升了性能,又即使在激进学习率下仍可实现训练稳定。第二,S3 通过统一的指数移动平均系数用于分子和分母动量,最小化损失尖峰的发生,天然将更新限制在[-1,1]范围内,从而简化了超参数调优。第三,S3 集成等效的 Nesterov 加速梯度(NAG)模块,在不增加内存开销的前提下加速收敛。理论上,我们证明 S3 在弱假设下实现了一般非凸随机优化的最优收敛率为 O(1/T^(1/4))。广泛实验表明,S3 不仅收敛更快且提升性能,而且即使在学习率放大 10 倍的情况下也几乎不会出现损失尖峰。事实上,S3 的性能可与使用 2 倍训练步数的 AdamW 相媲美或更好,证明了其在效率和最终任务性能方面的有效性。
引用
@article{arxiv.2507.06464,
title = {SoftSignSGD(S3): An Enhanced Optimizer for Practical DNN Training and Loss Spikes Minimization Beyond Adam},
author = {Hanyang Peng and Shuang Qin and Yue Yu and Fangqing Jiang and Hui Wang and Wen Gao},
journal= {arXiv preprint arXiv:2507.06464},
year = {2025}
}
备注
20pages, 11pages