中文

最小宽度插值神经网络的泛化性与稳定性

机器学习 2023-03-29 v2 机器学习

摘要

我们研究了在插值区域中由梯度下降训练的浅层神经网络分类器的泛化与优化性质。具体而言,在一个可实现场景中,模型权重可以达到任意小的训练误差 ϵ\epsilon,且它们与初始化的距离为 g(ϵ)g(\epsilon),我们证明:只要有至少 m=Ω(g(1/T)4)m=\Omega(g(1/T)^4) 个隐藏神经元,使用 nn 个训练数据的梯度下降在迭代 TT 时达到训练误差 O(g(1/T)2/T)O(g(1/T)^2 /T) 和泛化误差 O(g(1/T)2/n)O(g(1/T)^2 /n)。然后我们证明,我们的可实现设定涵盖了一种特殊情况,即数据可被模型的神经正切核分离。对于这种情况以及逻辑损失最小化,我们证明在给定多对数数量的神经元 m=Ω(log4(T))m=\Omega(\log^4 (T)) 时,训练损失以 O~(1/T)\tilde O(1/ T) 的速率衰减。此外,在 m=Ω(log4(n))m=\Omega(\log^{4} (n)) 个神经元和 TnT\approx n 次迭代下,我们将测试损失界定为 O~(1/n)\tilde{O}(1/n)。我们的结果不同于使用算法稳定性框架的现有泛化结果,后者需要多项式宽度并产生次优的泛化速率。我们分析的核心是使用一个新的自界弱凸性性质,该性质为充分参数化的神经网络分类器引出了一个广义局部拟凸性性质。最终,尽管目标函数非凸,这导致了类似于线性逻辑回归凸设定中的收敛和泛化差距界限。

关键词

引用

@article{arxiv.2302.09235,
  title  = {Generalization and Stability of Interpolating Neural Networks with Minimal Width},
  author = {Hossein Taheri and Christos Thrampoulidis},
  journal= {arXiv preprint arXiv:2302.09235},
  year   = {2023}
}

备注

With significant changes: Stating results without homogeneity assumption, Discussing results under NTK-separability in Section 4