中文

通过权重重缩实现方差控制的大语言模型预训练

机器学习 2025-03-25 v1 计算与语言 机器学习

摘要

大型语言模型(LLM)预训练的结果严重依赖于权重初始化和方差控制策略。尽管初始方差控制的重要性在神经网络领域已广为人知,但关于LLM预训练期间初始化及其方差增长管理的文献仍相对稀缺。本文引入了层索引重缩(Layer Index Rescaling, LIR)权重初始化方案,以及目标方差重缩(Target Variance Rescaling, TVR)方差控制策略。在10亿参数的LLaMA模型上实验表明,这些技术能够实现更好的方差管理,从而在下游任务性能上实现显著提升(在常见预训练基准测试中提升最高可达4.6%),并减少极端激活值,从而缓解量化和低精度训练所面临的挑战。我们的代码已公开:https://github.com/bluorion-com/weight_rescaling

关键词

引用

@article{arxiv.2503.17500,
  title  = {Variance Control via Weight Rescaling in LLM Pre-training},
  author = {Louis Owen and Abhay Kumar and Nilabhra Roy Chowdhury and Fabian Güra},
  journal= {arXiv preprint arXiv:2503.17500},
  year   = {2025}
}