中文

双层神经网络的 SGD 全局收敛性

机器学习 2024-12-24 v3 最优化与控制 机器学习

摘要

在本短文中,我们考虑具有任意数量门且深度为 22 的网络的适当正则化 2\ell_2-经验风险,并给出其上 SGD 迭代的经验损失演化界限——适用于任意数据,且激活函数如 sigmoid 和 tanh 那样充分平滑且有界。这进而导出了针对一类特殊初始化 SGD 全局收敛性的证明。我们还证明了连续时间 SGD 的指数级快速收敛速率,该速率也适用于如 SoftPlus 般平滑无界激活函数。我们的关键思想是证明在常量规模神经网络上存在 Frobenius 范数正则化损失函数,其为“Villani 函数”,从而能够基于近期对此类目标上 SGD 分析的进展。最关键的是,我们分析所需的正则化量与网络规模无关。

关键词

引用

@article{arxiv.2210.11452,
  title  = {Global Convergence of SGD On Two Layer Neural Nets},
  author = {Pulkit Gopalani and Anirbit Mukherjee},
  journal= {arXiv preprint arXiv:2210.11452},
  year   = {2024}
}

备注

22 pages, 6 figures. v3: Accepted at Information and Inference: A Journal of the IMA