分类问题中经验神经张量核的发散
机器学习
2025-07-15 v2 人工智能
机器学习
摘要
本文表明,在分类问题中,完全连接神经网络(FCN)和残差神经网络(ResNet)不能通过基于神经张量核(NTK)的核逻辑回归进行近似,尤其是在过训练(即训练时间趋于无穷大)时。具体而言,当使用交叉熵损失时,无论网络宽度有多大(只要是有限的),经验 NTK 都会在训练时间增加时与训练样本上的 NTK 发散。为了建立此结果,我们首先演示了多层 FCN 和 ResNet 的 NTK 具有严格正定性。然后,我们证明在训练期间(使用交叉熵损失),如果经验 NTK 矩阵(即Gram 矩阵)相对于训练样本的最小特征值保持在正常数以上,那么神经网络参数会发散。这种行为与回归问题中常见的懒惰训练范型截然不同。因此,通过反证法,我们展示了经验 NTK 在网络宽度增加时,不能在训练样本上的所有时间点上均匀收敛于 NTK。我们通过在合成数据和 MNIST 分类任务上的实验验证了理论结果。这一发现表明,NTK 理论在此背景下不适用,对理解分类问题中的神经网络具有重大的理论意义。
引用
@article{arxiv.2504.11130,
title = {Divergence of Empirical Neural Tangent Kernel in Classification Problems},
author = {Zixiong Yu and Songtao Tian and Guhan Chen},
journal= {arXiv preprint arXiv:2504.11130},
year = {2025}
}
备注
This is the revised version of our paper accepted at ICLR 2025, originally titled "Divergence of Neural Tangent Kernel in Classification Problems"