中文

有限宽度神经网络中双下降的现象学研究

机器学习 2022-03-15 v1 机器学习

摘要

“双下降”刻画了模型根据其所属 regime(欠参数化或过度参数化)的泛化行为。目前关于该现象发生的理论理解主要基于线性和核回归模型——并通过神经切线核与神经网络进行非正式类比。因此此类分析未能充分捕捉有限宽度神经网络中双下降背后的机制,且忽视了关键组分——例如损失函数的选择。我们通过利用影响函数推导总体损失及其下界的合适表达式,同时对参数模型形式施加最小假设,从而解决这些不足。我们导出的界与最优点处 Hessian 的谱密切相关,且重要的是,在插值阈值处表现出双下降行为。基于我们的分析,我们进一步研究损失函数如何影响双下降——并由此揭示神经网络及其在插值阈值附近 Hessian 谱的有趣性质。

关键词

引用

@article{arxiv.2203.07337,
  title  = {Phenomenology of Double Descent in Finite-Width Neural Networks},
  author = {Sidak Pal Singh and Aurelien Lucchi and Thomas Hofmann and Bernhard Schölkopf},
  journal= {arXiv preprint arXiv:2203.07337},
  year   = {2022}
}

备注

Published at ICLR 2022