中文

解耦正交动力学:深度网络优化器的正则化方法

机器学习 2026-02-06 v1

摘要

标准的 weight decay 在 AdamW 中是否 truly optimal?尽管 AdamW 解耦了 weight decay 与自适应梯度缩放,仍存在根本性冲突:径向拉锯(Radial Tug-of-War)。在深度学习中,梯度倾向于增加参数范数以扩大有效容量,同时引导方向以学习特征,而 weight decay 则不加区分地抑制范数增长。这种推--拉互动导致径向振荡,将噪声注入 Adam 的二阶矩估计,可能损害精细的切向特征学习。我们认为,大小与方向在优化器动力学中扮演不同角色,应在优化器中进行解耦。我们提出正交动力学解耦(Orthogonal Dynamics Decoupling),并将其实现为 AdamO:SGD 风格的更新处理一维范数控制,而 Adam 的自适应预条件化仅限于切向子空间。AdamO 还包括曲率自适应的径向步长调整以及面向可扩展层和低维参数的 architecture-aware 规则和投影。在视觉和语言任务上的实验表明,AdamO 在不引入额外复杂约束的情况下,优于 AdamW 在泛化性和稳定性方面表现更佳。

关键词

引用

@article{arxiv.2602.05136,
  title  = {Decoupled Orthogonal Dynamics: Regularization for Deep Network Optimizers},
  author = {Hao Chen and Jinghui Yuan and Hanmin Zhang},
  journal= {arXiv preprint arXiv:2602.05136},
  year   = {2026}
}