中文

更优的 NTK 条件数:宽神经网络中(ReLU)非线性激活的免费午餐

机器学习 2025-10-22 v2

摘要

非线性激活函数因增强神经网络表达能力而被广泛认可,这也是其被广泛采用的主要原因。在本工作中,我们聚焦于 ReLU 激活,并揭示了非线性激活一个新颖且引人入胜的性质。通过比较在神经网络中启用与禁用非线性激活,我们展示了它们对宽神经网络的具体影响:(a)更好的特征分离,即在模型梯度的特征空间中相似数据具有更大的角度分离;(b)更好的 NTK 条件数,即神经正切核(NTK)的条件数更小。此外,我们表明网络深度(即具有更多非线性激活操作)进一步放大了这些效应;另外,在无限宽后无限深的极限下,所有数据在模型梯度特征空间中以固定角度被等距分离,无论它们在输入空间中原本有多相似。注意,若无非线性激活,即在线性神经网络中,数据分离保持与原始输入相同,且 NTK 条件数等价于 Gram 矩阵,与网络深度无关。由于 NTK 条件数与收敛理论密切相关,我们的结果表明非线性激活有助于改善基于梯度方法的最坏情况收敛速率。

关键词

引用

@article{arxiv.2305.08813,
  title  = {Better NTK Conditioning: A Free Lunch from (ReLU) Nonlinear Activation in Wide Neural Networks},
  author = {Chaoyue Liu and Han Bi and Like Hui and Xiao Liu},
  journal= {arXiv preprint arXiv:2305.08813},
  year   = {2025}
}

备注

NeurIPS 2025