中文

深度可逆架构中的精确可解高斯-牛顿优化揭示泛化能力差

机器学习 2024-11-14 v2 人工智能

摘要

二阶优化已被证明在许多应用中能加速深度神经网络的训练,与一阶优化器相比,通常在训练损失上每次迭代能取得更快的进展。然而,二阶方法的泛化特性仍存在争议。理论探究已被证明难以在高度简化的模型类别的可解设定之外进行——因此,现有理论与实际深度学习应用的相关性仍不明确。同样,在大规模模型和真实数据集上的实证研究,由于在实践中必须对二阶更新进行近似而受到显著混淆。通常不清楚观察到的泛化行为是源于参数更新的二阶特性本身,还是反映了所使用的特定结构化(例如 Kronecker)近似或任何基于阻尼的向一阶更新的插值。在此,我们首次证明,精确的高斯-牛顿(Gauss-Newton, GN)更新在一类深度可逆架构中具有可解形式,这些架构具有足够的表达能力,可以有意义地应用于常见的基准数据集。我们利用这一新颖的设定来研究GN优化器的训练和泛化特性。我们发现精确的GN泛化能力差。在小批量训练设定中,这表现为即使在训练损失上进展也迅速饱和,参数更新被发现对每个小批量过拟合,而没有产生能够支持泛化到其他小批量的特征。我们表明,我们的实验运行在“惰性”机制下,其中神经正切核(Neural Tangent Kernel, NTK)在训练过程中变化很小。这种行为与神经表征没有显著变化相关,解释了泛化能力的缺乏。

关键词

引用

@article{arxiv.2411.07979,
  title  = {Exact, Tractable Gauss-Newton Optimization in Deep Reversible Architectures Reveal Poor Generalization},
  author = {Davide Buffelli and Jamie McGowan and Wangkun Xu and Alexandru Cioba and Da-shan Shiu and Guillaume Hennequin and Alberto Bernacchia},
  journal= {arXiv preprint arXiv:2411.07979},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024