中文

稀疏秩神经网络的泛化界

机器学习 2025-11-26 v3

摘要

近期大量文献中都指出,神经网络具有显著的秩瓶颈特性:对于更深的网络,基于梯度方法训练的神经网络的激活值和权重倾向于近似低秩。在事实上,网络各层激活值的秩会收敛到一个称为“瓶颈秩”的固定值,这是表示训练数据所需的最小秩。这种现象与对不含激活的线性网络进行权值衰减正则化等价于最小化神经网络的 Schatten pp 准范数观察相吻合。本文我们研究了这一现象对泛化的影响。具体而言,我们证明了针对存在近似低秩结构的神经网络的泛化界。最终结果依赖于网络权重矩阵的 Schatten pp 准范数:当 pp 较小时,界的样本复杂度为 O~(WrL2)\widetilde{O}(WrL^2),其中 WWLL 分别为神经网络的宽度和深度,而 rr 为权重矩阵的秩。随着 pp 的增大,界的行为更趋近于基于范数的界。

关键词

引用

@article{arxiv.2510.21945,
  title  = {Generalization Bounds for Rank-sparse Neural Networks},
  author = {Antoine Ledent and Rodrigo Alves and Yunwen Lei},
  journal= {arXiv preprint arXiv:2510.21945},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025