中文

深度学习中的泛化理论

机器学习 2026-05-05 v1 机器学习

摘要

我们提出一种深度学习中泛化的非渐近理论,其中经验神经异径化核(NTK)将输出空间划分为多个方向。在对应信号的方向上,误差快速消散;在对应噪声的广阔正交维度中,核的近零特征值将残差误差困在不可见测试的储存器中。在信号通道内,小批量 SGD 确保一致的 population 信号通过快速线性漂移积累,而独特记忆被抑制为慢速、扩散的随机漫步。我们证明,即使核演化 O(1)\mathcal{O}(1) 在算子范数中,泛化仍然存续,这涵盖了完整特征学习范型。该理论自然解释了深度学习理论中的各种现象,如良性 过拟合、双下降、隐式偏好和“grokking”。最后,我们从单次训练运行中推导出精确的 population-风险目标,无需验证数据,可适用于任意架构、损失函数或优化器,并证明其精确衡量信号通道中的噪声。该目标在实践中简化为在 Adam 之上添加一个信噪比 preconditioner,仅需一个状态向量且无需额外计算;它将 grokking 加速 5×5 \times,抑制 PINNs 和隐式神经表征中的记忆,并在带噪声偏好下的 DPO 微调中提升性能,同时仅为参考策略的 3×3 \times 距离。

关键词

引用

@article{arxiv.2605.01172,
  title  = {A Theory of Generalization in Deep Learning},
  author = {Elon Litman and Gabe Guo},
  journal= {arXiv preprint arXiv:2605.01172},
  year   = {2026}
}