中文

为何梯度在训练临近结束时快速增长

机器学习 2025-06-11 v2 人工智能

摘要

在长时间的大语言模型(LLM)训练过程中,梯度范数在训练临近结束时迅速增加。在这篇简短的笔记中,我们表明这种增加是由于权重衰减、归一化层和学习率调度之间无意的相互作用所致。我们提出了一种简单的修正方法,可以修复这种行为,同时还能在整个训练过程中获得更低的损失值。

关键词

引用

@article{arxiv.2506.02285,
  title  = {Why Gradients Rapidly Increase Near the End of Training},
  author = {Aaron Defazio},
  journal= {arXiv preprint arXiv:2506.02285},
  year   = {2025}
}