中文

深层网络中有效 Gram 矩阵刻画了泛化能力

机器学习 2025-10-14 v3 机器学习

摘要

我们推导了一个控制深度网络通过梯度下降训练时泛化间隙演化的微分方程。该微分方程由两个量控制: 一个将对应轻微不同数据集轨迹的轨迹拉拢在一起的收缩因子, 以及一个 accounting 它们在不同数据集上训练的扰动因子。 我们分析该微分方程以计算一个“有效 Gram 矩阵”, 用于以该 Gram 矩阵与某一初始“残差”之间的对齐来刻画泛化间隙。 在图像分类数据集上的经验评估表明, 这种分析能够准确预测测试损失。 此外, 在训练期间, 残差主要位于有效 Gram 矩阵最小特征值的子空间中。 这表明泛化间隙沿训练方向积累得较慢, 刻画了一种良性的训练过程。 我们通过“残差”和“有效 Gram 矩阵”之间的对齐模式, 提供了解释不同数据集和体系结构神经网络训练泛化能力的新视角。

关键词

引用

@article{arxiv.2504.16450,
  title  = {An Effective Gram Matrix Characterizes Generalization in Deep Networks},
  author = {Rubing Yang and Pratik Chaudhari},
  journal= {arXiv preprint arXiv:2504.16450},
  year   = {2025}
}