中文

深度神经网络与大语言模型中的权重初始化与方差动力学

机器学习 2025-10-13 v1

摘要

权重初始化控制着训练开始时的信号传播和梯度流动。本文提供了一项基于理论并经过实证验证的研究,涵盖两个领域:紧凑型 ReLU 多层感知器和 GPT-2 风格变换器。首先,对初始标准差进行对数扫描,映射出消失和爆炸区域,并识别出标准差在 1e-2 到 1e-1 之间的宽稳定带。其次,通过受控对比表明,在 ReLU 下 Kaiming(fan-in)初始化比 Xavier 收敛更快且更稳定,这与方差保持理论一致。第三,在从头训练的 12 层 GPT-2 风格模型中,本文追踪了预训练过程中的逐层 Q/K/V 权重方差,观察到深度依赖的平衡进入窄带:浅层快速扩展而深层变化更缓慢。这些结果将经典初始化原理与现代变换器行为联系起来,并为鲁棒训练提供了简单实用的方案。

关键词

引用

@article{arxiv.2510.09423,
  title  = {Weight Initialization and Variance Dynamics in Deep Neural Networks and Large Language Models},
  author = {Yankun Han},
  journal= {arXiv preprint arXiv:2510.09423},
  year   = {2025}
}

备注

8 pages, 6 figures