最小 L2 范数插值深 ReLU 网络稳定性的充分条件
机器学习
2026-02-17 v1 人工智能
摘要
算法稳定性是分析学习算法泛化误差的经典框架。它预测若算法对训练集的小扰动(如删除或替换训练点)不敏感,则其具有较小的泛化误差。尽管已证明众多著名算法具有稳定性,但该框架在深度神经网络分析中取得了有限成功。本文研究实现零训练误差并使用具有最小 范数参数的深 ReLU 同质神经网络的算法稳定性,亦即最小范数插值(minimum-norm interpolation),这是一种可在过参数化模型通过梯度-based 算法训练中观察到的现象。我们调查此类网络的稳定性充分条件。我们发现:1) 当网络包含一个(可能较小的)稳定子网络,其后接一个低秩权矩阵的层时,这类网络是稳定的;2) 即使包含稳定子网络,若后续层不低秩,这类网络也不一定稳定。低秩假设灵感来自最近的经验和理论结果,表明训练深度神经网络倾向于使用低秩权矩阵,这在最小范数插值和 weight-decay 正则化方面尤为如此。
引用
@article{arxiv.2602.13910,
title = {Sufficient Conditions for Stability of Minimum-Norm Interpolating Deep ReLU Networks},
author = {Ouns El Harzli and Yoonsoo Nam and Ilja Kuzborskij and Bernardo Cuenca Grau and Ard A. Louis},
journal= {arXiv preprint arXiv:2602.13910},
year = {2026}
}