中文

最小 L2 范数插值深 ReLU 网络稳定性的充分条件

机器学习 2026-02-17 v1 人工智能

摘要

算法稳定性是分析学习算法泛化误差的经典框架。它预测若算法对训练集的小扰动(如删除或替换训练点)不敏感,则其具有较小的泛化误差。尽管已证明众多著名算法具有稳定性,但该框架在深度神经网络分析中取得了有限成功。本文研究实现零训练误差并使用具有最小 L2L_2 范数参数的深 ReLU 同质神经网络的算法稳定性,亦即最小范数插值(minimum-norm interpolation),这是一种可在过参数化模型通过梯度-based 算法训练中观察到的现象。我们调查此类网络的稳定性充分条件。我们发现:1) 当网络包含一个(可能较小的)稳定子网络,其后接一个低秩权矩阵的层时,这类网络是稳定的;2) 即使包含稳定子网络,若后续层不低秩,这类网络也不一定稳定。低秩假设灵感来自最近的经验和理论结果,表明训练深度神经网络倾向于使用低秩权矩阵,这在最小范数插值和 weight-decay 正则化方面尤为如此。

关键词

引用

@article{arxiv.2602.13910,
  title  = {Sufficient Conditions for Stability of Minimum-Norm Interpolating Deep ReLU Networks},
  author = {Ouns El Harzli and Yoonsoo Nam and Ilja Kuzborskij and Bernardo Cuenca Grau and Ard A. Louis},
  journal= {arXiv preprint arXiv:2602.13910},
  year   = {2026}
}