两层神经网络上 SGD 对逻辑损失的全局收敛性
机器学习
2024-03-19 v2 最优化与控制
机器学习
摘要
在本注记中,我们展示了一种前所未有的可证明的 SGD 收敛性:对于深度为 的网络——在任意数据下且包含任意数量的具有充分平滑且有界激活函数(如 sigmoid 和 tanh)的门——SGD 收敛到适当正则化逻辑经验风险的全局最小值。我们还证明了连续时间 SGD 的指数级快速收敛速率,该结果也适用于如 SoftPlus 这类平滑无界激活函数。我们的核心思想是证明在常量规模神经网络上存在 Frobenius 范数正则化的逻辑损失函数,其为“Villani 函数”,从而能够基于近期关于此类目标上 SGD 分析的研究进展。
引用
@article{arxiv.2309.09258,
title = {Global Convergence of SGD For Logistic Loss on Two Layer Neural Nets},
author = {Pulkit Gopalani and Samyak Jha and Anirbit Mukherjee},
journal= {arXiv preprint arXiv:2309.09258},
year = {2024}
}
备注
18 Pages, 1 figure. Published in the Transactions on Machine Learning Research (TMLR) in Feb, 2024. arXiv admin note: substantial text overlap with arXiv:2210.11452