中文

小初始化下深度齐次神经网络的早期方向收敛

机器学习 2025-03-17 v3 最优化与控制 机器学习

摘要

本文研究训练深度齐次神经网络时产生的梯度流动力学,假设网络具有局部 Lipschitz 梯度且齐次阶数严格大于二。本文证明,对于足够小的初始化,在训练的早期阶段,神经网络的权重在(欧几里得)范数下保持较小,并在方向上近似收敛到最近引入的神经相关函数的 Karush-Kuhn-Tucker(KKT)点。此外,本文还研究了具有(Leaky)ReLU 和多项式(Leaky)ReLU 激活函数的前馈网络的神经相关函数的 KKT 点,推导了秩一 KKT 点的必要和充分条件。

关键词

引用

@article{arxiv.2403.08121,
  title  = {Early Directional Convergence in Deep Homogeneous Neural Networks for Small Initializations},
  author = {Akshay Kumar and Jarvis Haupt},
  journal= {arXiv preprint arXiv:2403.08121},
  year   = {2025}
}

备注

tmlr-final-version