中文

结合 Adam 及其逆变方法以提升深度学习优化器的泛化能力

机器学习 2026-03-10 v1 机器学习

摘要

在神经网络训练中,自适应矩估计(Adam)通常收敛速度快,但表现出次优的泛化性能。广泛接受的解释是其泛化能力差的原因是它倾向于收敛到锋利的极小值。为增强其寻找平坦极小值的能力,我们提出了新的变体称为逆 Adam(InvAdam)。InvAdam 的关键改进在于其参数更新机制,与 Adam 的更新机制相反。具体而言,InvAdam 计算一阶矩和二阶矩的元素级乘积,而 Adam 计算这两个矩的元素级除法。这种修改旨在在二阶矩元素较大时增加参数更新的步长,反之亦然,这有助于参数逃离锋利的极小值并停留在平坦的极小值上。然而,InvAdam 的更新机制可能面临收敛性挑战。为解决这一挑战,我们提出了双 Adam(DualAdam),将 Adam 和 InvAdam 的更新机制集成在一起,既确保收敛性,又提高泛化性能。此外,我们引入扩散理论来数学地说明 InvAdam 逃离锋利极小值的能力。在图像分类任务和大型语言模型(LLM)微调上进行了大量实验。结果表明,DualAdam 在泛化性能方面优于 Adam 及其最新变体。代码已公开available at https://github.com/LongJin-lab/DualAdam。

关键词

引用

@article{arxiv.2603.07122,
  title  = {Combining Adam and its Inverse Counterpart to Enhance Generalization of Deep Learning Optimizers},
  author = {Tao Shi and Liangming Chen and Long Jin and Mengchu Zhou},
  journal= {arXiv preprint arXiv:2603.07122},
  year   = {2026}
}