中文

具有平滑激活函数的深度学习模型的受限强凸性

机器学习 2022-10-03 v1 最优化与控制

摘要

我们考虑具有平滑激活函数的深度学习模型的优化问题。尽管从该“近初始化”视角出发已有颇具影响的结果,我们为该问题提供了相当新的见解。具体而言,对于具有LL层、mm宽度与σ02\sigma_0^2初始化方差的此类模型,我们作出两项关键技术贡献。首先,对于合适的σ02\sigma_0^2,我们建立了此类模型Hessian谱范数的O(poly(L)m)O(\frac{\text{poly}(L)}{\sqrt{m}})上界,显著改进了先前结果。其次,我们引入一种基于受限强凸性(RSC)的优化新分析,只要预测器平均梯度的平方范数为Ω(poly(L)m)\Omega(\frac{\text{poly}(L)}{\sqrt{m}})(对平方损失),该分析即成立。我们也给出了更一般损失下的结果。该基于RSC的分析无需“近初始化”视角,并保障梯度下降(GD)的几何收敛。据我们所知,我们的工作是首个基于RSC建立深度学习模型GD几何收敛的结果,从而成为不依赖于广泛使用的神经切线核(NTK)的收敛的替代充分条件。我们给出了支持理论进展的初步实验结果。

关键词

引用

@article{arxiv.2209.15106,
  title  = {Restricted Strong Convexity of Deep Learning Models with Smooth Activations},
  author = {Arindam Banerjee and Pedro Cisneros-Velarde and Libin Zhu and Mikhail Belkin},
  journal= {arXiv preprint arXiv:2209.15106},
  year   = {2022}
}