中文

AdamHD:解耦Huber衰减正则化的语言模型预训练

机器学习 2025-11-19 v1 最优化与控制

摘要

具有解耦权重衰减的自适应优化器(如AdamW)是预训练大型基于变换器的生成模型的事实标准。然而,2\ell_2惩罚的二次性质使得所有参数都以相同的速率向原点衰减,使得更新对稀疏但极端梯度方向十分脆弱,并且常常对良好条件坐标过度惩罚。我们提出AdamHuberDecay,作为AdamW的即插即用替代方案,将2\ell_2惩罚替换为解耦的平滑Huber正则化器。 resulting update(最终更新)在参数幅值小于阈值δ\delta时以二次方式衰减参数,超过δ\delta时以线性(1\ell_1-样)方式衰减,从而实现(i)受限的正则化梯度,(ii)对每个坐标的二阶矩重新缩放的不变性,(iii)对过度生长权重的更强稀疏压力。我们推导了解耦Huber衰减步骤的闭式公式,展示如何将其集成到任何Adam族优化器中仅增加O(1)的计算开销。对GPT-2和GPT-3预训练进行大量实验,表明AdamHuberDecay(a)在墙钟时间上收敛快10%-15%,(b)验证困惑度降低最高可达4分,(c)在下游任务中性能提升2.5%-4.7%,(d)产生可见的稀疏权重直方图,微调后可实现20%-30%的存储节省,且无需调整衰减系数 beyond AdamW使用的默认网格。消融实验确认其对异常梯度和大批量情形的鲁棒性,并提供理论分析,给出在噪声更新下参数范数预期上界。AdamHuberDecay为下一代基础生成式变换器的更高效、更具韧性训练提供了一条简单、原则的方法。

关键词

引用

@article{arxiv.2511.14721,
  title  = {AdamHD: Decoupled Huber Decay Regularization for Language Model Pre-Training},
  author = {Fu-Ming Guo and Yingfang Fan},
  journal= {arXiv preprint arXiv:2511.14721},
  year   = {2025}
}

备注

39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: GPU-Accelerated and Scalable Optimization (ScaleOpt)