为何梯度在训练临近结束时快速增长
机器学习
2025-06-11 v2 人工智能
摘要
在长时间的大语言模型(LLM)训练过程中,梯度范数在训练临近结束时迅速增加。在这篇简短的笔记中,我们表明这种增加是由于权重衰减、归一化层和学习率调度之间无意的相互作用所致。我们提出了一种简单的修正方法,可以修复这种行为,同时还能在整个训练过程中获得更低的损失值。
引用
@article{arxiv.2506.02285,
title = {Why Gradients Rapidly Increase Near the End of Training},
author = {Aaron Defazio},
journal= {arXiv preprint arXiv:2506.02285},
year = {2025}
}