中文

不再尖峰:稳定大语言模型的预训练

计算与语言 2025-07-28 v4 人工智能

摘要

大语言模型的预训练过程中经常出现损失尖峰。这些尖峰会降低大语言模型的性能,有时甚至会破坏预训练过程。由于预训练需要庞大的计算预算,我们应当避免此类尖峰。基于损失尖峰是由梯度范数突然增长引起的假设,我们通过对子层的雅可比矩阵的谱范数进行分析,探索了保持梯度范数较小的因素。我们的发现表明,稳定预训练过程需要两个条件:小的子层和大的快捷连接。我们进行了各种实验以实证验证我们的理论分析。实验结果表明,满足这些条件的方法能有效防止预训练期间的损失尖峰。

关键词

引用

@article{arxiv.2312.16903,
  title  = {Spike No More: Stabilizing the Pre-training of Large Language Models},
  author = {Sho Takase and Shun Kiyono and Sosuke Kobayashi and Jun Suzuki},
  journal= {arXiv preprint arXiv:2312.16903},
  year   = {2025}
}

备注

COLM 2025