核方法能否解释数据如何影响神经坍缩?
机器学习
2025-04-28 v3 人工智能
信息论
math.IT
机器学习
摘要
大量文献最近关注了“神经坍缩”(NC)现象,该现象在训练神经网络(NN)分类器超过零训练误差点后出现。NC 的核心组成部分是网络最深特征类内变异性的降低,称为 NC1。研究 NC 的理论工作通常基于简化的无约束特征模型(UFM),这些模型掩盖了数据对坍缩程度的影响。为了解决 UFM 的这一局限性,本文探索了使用与浅层 NN 相关的核来分析 NC1 的可能性。我们首先将 NC1 度量表述为核的函数。然后,我们将其专门化为 NN 高斯过程核(NNGP)和神经正切核(NTK),它们分别与初始化时的宽网络和基于梯度的小学习率训练相关联。作为一个关键结果,我们证明对于任意维数的高斯数据,NTK 并不比 NNGP 表示更坍缩的特征。这展示了诸如 NTK 之类的数据无关核在近似 NN 的 NC 行为方面的局限性。作为 NTK 的替代,我们随后经验性地探索了一个最近提出的数据感知高斯过程核,它推广了 NNGP 以建模特征学习。我们证明该核产生的 NC1 低于 NNGP,但可能不遵循浅层 NN 的趋势。我们的研究表明,对数据的适应性可能允许基于核的 NC 分析,尽管该领域仍需进一步进展。我们研究的一个有益副产品是,从理论和经验上证明了非线性激活函数的选择会影响 NC1(ERF 产生的值低于 ReLU)。代码可在 https://github.com/kvignesh1420/shallow_nc1 获取。
引用
@article{arxiv.2406.02105,
title = {Can Kernel Methods Explain How the Data Affects Neural Collapse?},
author = {Vignesh Kothapalli and Tom Tirer},
journal= {arXiv preprint arXiv:2406.02105},
year = {2025}
}
备注
Transactions on Machine Learning Research (TMLR)