中文

使用权重衰减训练的宽神经网络可证明表现出神经坍缩

机器学习 2024-10-08 v1 最优化与控制 机器学习

摘要

深度神经网络(DNN)在收敛时,其最后一层对训练数据的表示始终呈现出高度对称的几何结构,称为神经坍缩。这一经验证据激发了一系列旨在证明神经坍缩出现的理论研究,其中大部分集中在无约束特征模型上。在该模型中,倒数第二层的特征是自由变量,这使得模型与数据无关,因此对其捕捉DNN训练的能力提出了质疑。我们的工作解决了这个问题,摆脱了无约束特征,转而研究以至少两个线性层结尾的DNN。我们首先证明了关于神经坍缩的通用保证,这些保证假设(i)低训练误差和线性层的平衡性(用于类内变异性坍缩),以及(ii)线性部分之前特征的有界条件数(用于类均值正交性及其与权重矩阵的对齐)。然后,我们证明这些假设在使用权重衰减的梯度下降训练下成立:(i)对于具有宽第一层的网络,我们证明了低训练误差和平衡性,以及(ii)对于接近最优或在较大学习率下稳定的解,我们额外证明了有界条件数。综合起来,我们的结果是首次在DNN的端到端训练中展示神经坍缩。

关键词

引用

@article{arxiv.2410.04887,
  title  = {Wide Neural Networks Trained with Weight Decay Provably Exhibit Neural Collapse},
  author = {Arthur Jacot and Peter Súkeník and Zihan Wang and Marco Mondelli},
  journal= {arXiv preprint arXiv:2410.04887},
  year   = {2024}
}

备注

29 pages, 5 figures