中文

AlphaDecay:用于LLMs重尾平衡的模块级权重衰减

计算与语言 2025-11-06 v3 人工智能 机器学习

摘要

权重衰减是训练大型语言模型(LLMs)的标准正则化技术。虽然对每一层分配统一的衰减率是常见做法,但这种方法忽略了LLMs的结构多样性以及不同模块之间谱特性的差异。本文引入AlphaDecay,这是一种简单而有效的方法,为LLM的每个模块自适应分配不同的权重衰减强度。我们的方法依据重尾自正则化(HT-SR)理论而来,后者通过分析权重相关矩阵的经验谱密度(ESD)来量化“重尾程度”。表明更显著重尾ESD的模块反映出更强的特征学习,应分配较弱的衰减,而谱尾较轻的模块应分配较强的衰减。我们的方法利用量身定制的权重衰减分配来平衡模块间在谱特性方面的差异,从而实现更好的性能。针对各种模型规模从60M到1B的广泛预训练任务,AlphaDecay在困惑度和泛化能力方面均优于常规统一衰减及其他自适应衰减基线方法。我们的代码已公开于https://github.com/hed-ucas/AlphaDecay。

关键词

引用

@article{arxiv.2506.14562,
  title  = {AlphaDecay: Module-wise Weight Decay for Heavy-Tailed Balancing in LLMs},
  author = {Di He and Songjun Tu and Ajay Jaiswal and Li Shen and Ganzhao Yuan and Shiwei Liu and Lu Yin},
  journal= {arXiv preprint arXiv:2506.14562},
  year   = {2025}
}