中文

深度网络的 Lipschitz 常数与双下降现象

机器学习 2025-07-24 v5

摘要

现有的深度网络泛化误差界假设了对输入变量的某种平滑或有界依赖,未能探究实践中控制此类因素的机制。在这项工作中,我们对经历双下降的深度网络的经验 Lipschitz 常数进行了广泛的实验研究,并突出了与测试误差强相关的非单调趋势。通过在临界点附近为 SGD 建立参数空间与输入空间梯度之间的联系,我们分离出两个重要因素——即损失景观曲率和参数距初始化的距离——分别控制临界点附近的优化动态并界定模型函数复杂度,甚至超出训练数据范围。我们的研究为通过过参数化实现的隐式正则化以及实际训练网络的有效模型复杂度提供了新的见解。

关键词

引用

@article{arxiv.2301.12309,
  title  = {On the Lipschitz Constant of Deep Networks and Double Descent},
  author = {Matteo Gamba and Hossein Azizpour and Mårten Björkman},
  journal= {arXiv preprint arXiv:2301.12309},
  year   = {2025}
}