中文

面向稳定高效神经网络训练的深度感知初始化

机器学习 2025-09-08 v1

摘要

在过去几年中,提出了多种初始化方案,如 Glorot 初始化、He 初始化、使用正交矩阵的初始化、随机游走初始化方法。其中一些方法强调保持激活值和梯度在网络层中传播的单位方差。这些方法中,有些与网络深度信息无关,而另一些则考虑了总网络深度以实现更好的初始化。本文进行了全面研究,将每层的深度信息以及总网络深度信息纳入考量,以设计更好的初始化方案。研究还发现,对于更深的网络,保持整个网络单位方差的理论假设表现不佳,这需要增加从第一层激活到最后一层激活的方差。我们提出了一种新颖的方法,以灵活的方式增加网络方差,该方法融入了每层的深度信息。实验表明,所提出的方法优于现有的初始化方案。

关键词

引用

@article{arxiv.2509.05018,
  title  = {Depth-Aware Initialization for Stable and Efficient Neural Network Training},
  author = {Vijay Pandey},
  journal= {arXiv preprint arXiv:2509.05018},
  year   = {2025}
}