中文

深度神经网络的神经特征假设

机器学习 2025-10-20 v1

摘要

理解特征学习是建立深度神经网络数学基础的重要开放问题。神经特征假设(NFA)指出,经过训练后,深度神经网络第一层权重的格拉姆矩阵与该网络相对于其输入的平均梯度外积(AGOP)的某个幂 α>0\alpha>0 成比例。假设梯度流动动力学和均衡权重初始化,NFA 在指数 α=1/2\alpha = 1/2(Radhakrishnan 等,2024)下对于两层线性网络在训练期间成立。我们将该结果推广到 L2L \geq 2 层的网络,证明NFA 以指数 α=1/L\alpha = 1/L 成立,从而展示了NFA 的深度依赖性。此外,我们证明对于非均衡初始化,若应用权重衰减,NFA 在训练期间可渐近地成立。我们还提供反例表明,对于具有非线性激活函数的某些网络架构,即使这些网络在训练数据上拟合得非常好,NFA 也不成立。我们通过数值实验彻底验证了理论结果,包括各种优化算法、权重衰减率和初始化方案。

关键词

引用

@article{arxiv.2510.15563,
  title  = {On the Neural Feature Ansatz for Deep Neural Networks},
  author = {Edward Tansley and Estelle Massart and Coralia Cartis},
  journal= {arXiv preprint arXiv:2510.15563},
  year   = {2025}
}