中文

路径正则化:面向多层神经网络与双重下降现象的近完备最优非渐近泛化理论

机器学习 2026-04-09 v2 人工智能 统计理论 统计理论

摘要

路径正则化已被证明是训练神经网络的一种非常有效的正则化方法,与权重衰减等常见正则化方法相比,它能带来更好的泛化性能。针对具有路径正则化的多层神经网络的一般学习问题,我们提出了一种首个近完备的(将在正文中明确说明)非渐近泛化理论。特别地,它不需要文献中通常假设的损失函数有界性。我们的理论超越了偏差-方差权衡,并与深度学习中通常遇到的现象相吻合。因此,它与其他现有的非渐近泛化误差界截然不同。更明确地说,我们为具有 σ(0)=0\sigma(0)=0 和足够宽的 Lipschitz 损失函数的多层神经网络提出了一个显式的泛化误差上界,且不要求神经网络的宽度、深度或其他超参数趋于无穷大,不依赖特定的神经网络架构(例如稀疏性、某些范数的有界性)、特定的优化算法或损失函数的有界性,同时还考虑了逼近误差。我们理论的一个关键特征是它也考虑了逼近误差。特别地,我们解决了 Weinan E 等人提出的关于广义 Barron 空间中逼近率的一个开放问题。此外,我们展示了我们的理论对于具有 ReLU 激活函数的回归问题的近极小极大最优性。值得注意的是,我们的上界在此类网络中表现出著名的双重下降现象,这是与其他现有结果相比最显著的特征。我们认为,我们的理论极有可能揭示了双重下降现象的真正潜在机制。

关键词

引用

@article{arxiv.2503.02129,
  title  = {Path Regularization: A Near-Complete and Optimal Nonasymptotic Generalization Theory for Multilayer Neural Networks and Double Descent Phenomenon},
  author = {Hao Yu},
  journal= {arXiv preprint arXiv:2503.02129},
  year   = {2026}
}