中文

二齐次神经网络中小初始化与鞍点附近的方向收敛

机器学习 2024-12-10 v2 最优化与控制 机器学习

摘要

本文研究了二齐次神经网络在小初始化(即所有权重均在原点附近初始化)下的梯度流动力学。对于平方损失和逻辑损失,研究表明,对于足够小的初始化,梯度流动力学会在原点邻域内停留足够长的时间,使得神经网络的权重在方向上近似收敛到神经相关函数的 Karush-Kuhn-Tucker (KKT) 点,该函数量化了神经网络输出与训练数据集中相应标签之间的相关性。对于平方损失,已观察到神经网络在靠近原点初始化时会经历鞍点到鞍点的动力学。受此启发,本文还展示了在某些鞍点邻域内小量级权重之间类似的方向收敛性。

关键词

引用

@article{arxiv.2402.09226,
  title  = {Directional Convergence Near Small Initializations and Saddles in Two-Homogeneous Neural Networks},
  author = {Akshay Kumar and Jarvis Haupt},
  journal= {arXiv preprint arXiv:2402.09226},
  year   = {2024}
}

备注

tmlr-final-version