基于 $\varepsilon$-秩加速训练过程的结构化第一层初始化预训练技术
数值分析
2025-07-17 v1 数值分析
摘要
由于在训练早期阶段多样化特征表示的形成缓慢,用于科学计算的训练深度神经网络在计算上仍然代价高昂。最近的研究在训练动力学中发现了阶梯现象,即损失的减少与 -秩的增加密切相关,而 -秩反映了线性无关神经元函数的有效数量。受此观察启发,本工作提出了一种结构化第一层初始化(SFLI)预训练方法,通过在输入层构造 -线性无关的神经元来增强初始化时神经特征的多样性。我们提出了与各种激活函数兼容的系统初始化方案,并将该策略集成到多种神经架构中,包括修改的多层感知器和物理信息残差自适应网络。在函数逼近和 PDE 基准上的大量数值实验表明,SFLI 显著提高了初始 -秩,加速了收敛,减轻了谱偏差,并提高了预测精度。借助 SILP,我们只需在现有的传统算法中添加一行代码即可。
关键词
引用
@article{arxiv.2507.11962,
title = {Structured First-Layer Initialization Pre-Training Techniques to Accelerate Training Process Based on $\varepsilon$-Rank},
author = {Tao Tang and Jiang Yang and Yuxiang Zhao and Quanhui Zhu},
journal= {arXiv preprint arXiv:2507.11962},
year = {2025}
}