理解泛化误差中的过拟合峰:$l_2$与$l_1$惩罚插值下的解析风险曲线
机器学习
2019-06-11 v1 数据分析、统计与概率
机器学习
摘要
传统上在回归中,人们最小化拟合参数数量或使用平滑/正则化来权衡训练误差(TE)与泛化误差(GE)。通过增加拟合自由度(dof)将TE驱动到零预期会增大GE。然而现代大数据方法,包括深度网络,似乎过度参数化并将TE驱动到零(数据插值)而不影响GE。过度参数化的好处是经验损失函数的全局极小大量增殖并更容易找到。这些现象引起了理论关注。已有回归和分类算法被证明可插值数据且最优泛化。一个有趣的相关现象被注意到:存在非单调风险曲线,GE随dof增加出现峰值。有人提出该峰值将经典 regime 与现代 regime 分开,后者中过度参数化改善性能。类似的过拟合峰先前已有报道(学习的统计物理方法)并归因于拟合模型灵活性的增加。我们引入一个生成与拟合模型对(“误设定稀疏回归”即MiSpaR),并表明过拟合峰可与拟合函数获得足够dof以匹配数据生成模型从而提供良好泛化的点相分离,这使将过拟合峰解释为分隔“经典”与“现代” regime 复杂化。数据插值本身不能保证良好泛化:我们需要研究具有不同惩罚项的插值。我们给出MiSpaR在插值极限下带和惩罚的GE曲线解析公式。这些风险曲线展现出重要差异并有助于阐明潜在现象。
引用
@article{arxiv.1906.03667,
title = {Understanding overfitting peaks in generalization error: Analytical risk curves for $l_2$ and $l_1$ penalized interpolation},
author = {Partha P Mitra},
journal= {arXiv preprint arXiv:1906.03667},
year = {2019}
}
备注
15 pages, 4 figures