优化在双下降中作用的研究:基于最小二乘的分析
机器学习
2021-07-28 v1 最优化与控制
机器学习
摘要
经验观察表明,深度神经网络的性能随模型规模增大而稳步提升,这与关于过拟合和泛化的经典观点相矛盾。近来,双下降现象被提出以调和该观察与理论,表明当模型变得足够过参数化时测试误差会出现第二次下降,因为模型规模本身充当了隐式正则化器。在本文中,我们为这一领域日益增长的研究做出贡献,针对最小二乘情形仔细研究了作为模型规模函数的学习动态。我们给出了最小二乘目标梯度下降解的超额风险界。该界通过最小非零特征值依赖于输入特征协方差矩阵的函数形式,具有双下降行为。这为文献中报道的双下降曲线提供了新视角。我们对超额风险的分析能够解耦优化与泛化误差的影响。特别地,我们发现,在无噪声回归情形下,双下降完全由优化相关量解释,而专注于 Moore-Penrose 伪逆解的研究忽略了这一点。我们认为,我们的推导提供了与现有工作不同的视角,至少在所考虑的最小二乘设定下,对这一现象的可能成因有所阐明。我们经验性地探索了我们的预测是否对神经网络成立,特别是中间隐藏激活的协方差是否具有与我们推导所预测的相似行为。
引用
@article{arxiv.2107.12685,
title = {On the Role of Optimization in Double Descent: A Least Squares Study},
author = {Ilja Kuzborskij and Csaba Szepesvári and Omar Rivasplata and Amal Rannen-Triki and Razvan Pascanu},
journal= {arXiv preprint arXiv:2107.12685},
year = {2021}
}