中文

两层神经网络上 SGD 对逻辑损失的全局收敛性

机器学习 2024-03-19 v2 最优化与控制 机器学习

摘要

在本注记中,我们展示了一种前所未有的可证明的 SGD 收敛性:对于深度为 22 的网络——在任意数据下且包含任意数量的具有充分平滑且有界激活函数(如 sigmoid 和 tanh)的门——SGD 收敛到适当正则化逻辑经验风险的全局最小值。我们还证明了连续时间 SGD 的指数级快速收敛速率,该结果也适用于如 SoftPlus 这类平滑无界激活函数。我们的核心思想是证明在常量规模神经网络上存在 Frobenius 范数正则化的逻辑损失函数,其为“Villani 函数”,从而能够基于近期关于此类目标上 SGD 分析的研究进展。

关键词

引用

@article{arxiv.2309.09258,
  title  = {Global Convergence of SGD For Logistic Loss on Two Layer Neural Nets},
  author = {Pulkit Gopalani and Samyak Jha and Anirbit Mukherjee},
  journal= {arXiv preprint arXiv:2309.09258},
  year   = {2024}
}

备注

18 Pages, 1 figure. Published in the Transactions on Machine Learning Research (TMLR) in Feb, 2024. arXiv admin note: substantial text overlap with arXiv:2210.11452