中文

浅层非线性网络中的线性可分特征:宽度与数据内在维度成多项式比例

机器学习 2026-03-20 v2 计算机视觉与模式识别 机器学习

摘要

深度神经网络在各种分类任务中取得了显著成功。最近的实证研究表明,深度网络学习到的特征在类别之间是线性可分的。然而,这些发现往往缺乏严格的证明,即使在相对简单的设置下也是如此。在这项工作中,我们通过研究浅层非线性网络的线性分离能力来弥补这一差距。具体来说,受图像数据低内在维度的启发,我们将输入建模为低维子空间(UoS)的并集,并证明单个非线性层可以将此类数据转换为线性可分的集合。理论上,我们证明当使用随机权重和二次激活时,这种转换以高概率发生。值得注意的是,我们证明当网络宽度与数据的内在维度(而非环境维度)成多项式比例时,可以实现这一点。实验结果证实了这些理论发现,并表明类似的线性分离性质在我们分析范围之外的实际场景中也成立。这项工作弥合了经验观察与对非线性网络分离能力的理论理解之间的差距,为模型可解释性和泛化提供了更深入的见解。

关键词

引用

@article{arxiv.2501.02364,
  title  = {Linearly Separable Features in Shallow Nonlinear Networks: Width Scales Polynomially with Intrinsic Data Dimension},
  author = {Alec S. Xu and Can Yaras and Peng Wang and Qing Qu},
  journal= {arXiv preprint arXiv:2501.02364},
  year   = {2026}
}

备注

33 pages, 10 figures