全局经验性NTK:梯度下降学习的自指偏差与维数
机器学习
2026-05-12 v1 动力系统
最优化与控制
摘要
在使用梯度下降(GD)训练神经网络时,每一次迭代都会诱导一个线性算子,支配模型内部状态变量的一阶更新。我们将该算子定义为全局经验性神经切iment kernel(NTK)。在有限宽度网络中,NTK 通常难以形成,导致 prior work 聚焦于限制性设置,如仅跟踪输出或取无限宽度极限。本文我们研究了 various models 的 NTK 结构。通过将模型状态 formulation 为单个全局隐式约束的解,我们推导了 NTK 作为两个算子的乘积:K,负责参数到状态的即时相互作用,P,描述内部状态之间的依赖。对于广泛的基于权重的模型,包括 RNN 和 transformer,我们证明了一个通用的Kronecker-core 定理,表明 K 采用由权重位变量 Gram 矩阵给出的精确、可计算形式。这种核心结构揭示了 NTK 是结构性瓶颈,限制其有效秩,从而产生一种自指偏差,即 GD 对学习在联合隐藏和输入活动的主导模式内的任务具有偏好。对于循环模型,我们检查了 NTK 的谱,并展示了在所提出的分解下,何时在空间或时间上是偏好的且低秩的。我们进一步演示了在初始化时,模型动力学会偏向 NTK,限制学习并防止任务组件有效学习。最后,我们表明与自注意力 transformer 相关的 NTK 同样在结构上受限于低秩。总体而言,我们表明 NTK 具有可计算的结构,解释了 GD 对任务解决方案的偏好以及低秩表示的出现。为使 NTK 作为实用度量,我们构建了 kpflow,一个依赖随机矩阵自由数值线性代数的库。
关键词
引用
@article{arxiv.2605.08746,
title = {The Global Empirical NTK: Self-Referential Bias and Dimensionality of Gradient Descent Learning},
author = {James Hazelden and Laura Driscoll and Eli Shlizerman and Eric Shea-Brown},
journal= {arXiv preprint arXiv:2605.08746},
year = {2026}
}
备注
Submitted to TMLR