IDInit:神经网络训练的通用稳定初始化方法
机器学习
2025-03-11 v2 人工智能
摘要
深度神经网络在实际应用中取得了显著成就。其成功取决于有效的初始化方法,这对于确保训练期间的稳定和快速收敛至关重要。最近,一些保持层内恒等转换的初始化方法在网络训练中表现良好。这些技术(如Fixup)通过将特定权重设置为零来实现恒等控制。然而,其余权重的设置(如Fixup使用随机值初始化非零权重)会影响仅由零权重实现的归纳偏置,可能对训练产生不利影响。为此,我们引入了全等初始化(IDInit),一种新的方法,旨在在残差网络的主干层和子干层中保持恒等。IDInit采用填充的类恒等矩阵来克服非方形权重矩阵的秩限制。此外,我们证明了恒等矩阵的收敛问题可通过随机梯度下降求解。进一步地,我们通过处理高阶权重和解决死神经元问题来提高IDInit的通用性。IDInit是一种简单而有效的初始化方法,在各种设置下(包括大规模数据集和深层模型)均实现了改进的收敛性、稳定性和性能。
引用
@article{arxiv.2503.04626,
title = {IDInit: A Universal and Stable Initialization Method for Neural Network Training},
author = {Yu Pan and Chaozheng Wang and Zekai Wu and Qifan Wang and Min Zhang and Zenglin Xu},
journal= {arXiv preprint arXiv:2503.04626},
year = {2025}
}
备注
Accepted in ICLR 2025