中文

高维神经正切核:三重下降与泛化的多尺度理论

机器学习 2020-08-18 v1 机器学习

摘要

现代深度学习模型使用的参数远多于拟合训练数据所需。尽管传统统计观点表明此类模型应严重过拟合,实践中它们却泛化得异常好。描述这一意外行为的新兴范式是\emph{双重下降}曲线,其中增加模型容量使其测试误差先下降,然后在插值阈值附近上升至最大值,随后在过参数化区间再次下降。近期解释该现象的理论努力集中于简单设定,如线性回归或具有非结构化随机特征的内核回归,我们认为其过于粗糙而未能揭示实际神经网络的的重要细微差别。我们提供基于神经正切核的内核回归下泛化的精确高维渐近分析,刻画了用梯度下降优化的宽神经网络的行为。我们的结果揭示测试误差在深度过参数化区间具有非单调行为,甚至当参数数量随数据集大小二次缩放时可展现额外的峰值与下降。

关键词

引用

@article{arxiv.2008.06786,
  title  = {The Neural Tangent Kernel in High Dimensions: Triple Descent and a Multi-Scale Theory of Generalization},
  author = {Ben Adlam and Jeffrey Pennington},
  journal= {arXiv preprint arXiv:2008.06786},
  year   = {2020}
}

备注

Published as a conference paper in the Proceedings of the 37th International Conference on Machine Learning; 31 pages; 4 figures