通过重参数化来缓解大型语言模型初始化中的损失峰值
计算与语言
2024-10-08 v1
摘要
损失峰值是指损失值突然发散的现象,这是大型语言模型预训练中的一个根本性问题。本文认为参数范数非均匀性是导致损失峰值的原因之一。在神经网络训练中,梯度的尺度需要在各层之间保持恒定,以避免梯度消失和爆炸问题。然而,在Transformer模型中,这些要求导致模型参数的范数必须是非均匀的,从而使得范数较小的参数对参数更新更敏感。为此,我们提出了一种新技术,即权重缩放重参数化(WeSaR)。WeSaR为每个参数矩阵引入一个门参数,并将其调整为满足要求的值。由于门参数,WeSaR将原始参数的范数设置为均匀,从而实现稳定训练。在由1.3亿、13亿和130亿参数构成的Transformer解码器上的实验结果表明,WeSaR稳定加速了训练,并优于包括流行初始化方法在内的其他方法。
引用
@article{arxiv.2410.05052,
title = {Initialization of Large Language Models via Reparameterization to Mitigate Loss Spikes},
author = {Kosuke Nishida and Kyosuke Nishida and Kuniko Saito},
journal= {arXiv preprint arXiv:2410.05052},
year = {2024}
}
备注
EMNLP2024 accepted