由大偏置诱导稀疏激活的神经网络:基于偏置广义NTK的更紧分析
机器学习
2024-10-31 v3
摘要
我们研究神经正切核(NTK)机制下训练单隐藏层ReLU网络,其中网络偏置初始化为某常数而非零。我们证明在此类初始化下,神经网络在整个训练过程中将具有稀疏激活,这使得通过某些精细计算方法实现快速训练过程成为可能。在此初始化下,我们表明神经网络拥有一种不同的极限核,我们称之为\textit{偏置广义NTK},并研究了具有该新核的神经网络的各种性质。我们首先刻画了梯度下降动态。特别地,我们表明此情形下的网络能实现与稠密网络一样快的收敛,而此前工作认为稀疏网络收敛更慢。此外,我们的结果改进了此前确保收敛所需的宽度要求。其次,我们研究网络的泛化:我们展示了宽度-稀疏性依赖关系,由此得出依赖于稀疏性的Rademacher复杂度和泛化界。据我们所知,这是首个通过Rademacher复杂度的稀疏性依赖泛化结果。最后,我们研究该新核的最小特征值。我们确定了一个数据依赖区域,在其中我们能导出比此前已知最坏情况界更尖锐的NTK最小特征值下界。这可带来泛化界的改进。
引用
@article{arxiv.2301.00327,
title = {Neural Networks with Sparse Activation Induced by Large Bias: Tighter Analysis with Bias-Generalized NTK},
author = {Hongru Yang and Ziyu Jiang and Ruizhe Zhang and Yingbin Liang and Zhangyang Wang},
journal= {arXiv preprint arXiv:2301.00327},
year = {2024}
}