双层神经网络的 SGD 全局收敛性
机器学习
2024-12-24 v3 最优化与控制
机器学习
摘要
在本短文中,我们考虑具有任意数量门且深度为 的网络的适当正则化 经验风险,并给出其上 SGD 迭代的经验损失演化界限——适用于任意数据,且激活函数如 sigmoid 和 tanh 那样充分平滑且有界。这进而导出了针对一类特殊初始化 SGD 全局收敛性的证明。我们还证明了连续时间 SGD 的指数级快速收敛速率,该速率也适用于如 SoftPlus 般平滑无界激活函数。我们的关键思想是证明在常量规模神经网络上存在 Frobenius 范数正则化损失函数,其为“Villani 函数”,从而能够基于近期对此类目标上 SGD 分析的进展。最关键的是,我们分析所需的正则化量与网络规模无关。
引用
@article{arxiv.2210.11452,
title = {Global Convergence of SGD On Two Layer Neural Nets},
author = {Pulkit Gopalani and Anirbit Mukherjee},
journal= {arXiv preprint arXiv:2210.11452},
year = {2024}
}
备注
22 pages, 6 figures. v3: Accepted at Information and Inference: A Journal of the IMA