正则化意义上的双下降:其成因与消除方法
机器学习
2022-06-06 v1 机器学习
摘要
过参数化模型(尤其是深度神经网络)的风险常作为模型规模的函数呈双下降形状。近来有研究表明,风险作为早停时间的函数也可呈双下降形状,且该行为可解释为偏差-方差权衡的叠加。本文中,我们表明显式L2正则化模型的风险作为正则化强度的函数可在理论与实践中均呈现双下降行为。我们发现,对于线性回归,双下降形状的风险由对应于模型不同部分的偏差-方差权衡叠加引起,并可通过适当缩放各部分的正则化强度来缓解。受此结果启发,我们研究了一个两层神经网络,并表明通过调整第一层与第二层的正则化强度可消除双下降。最后,我们研究了在带标签噪声的CIFAR-10和无标签噪声的CIFAR-100上训练的5层CNN与ResNet-18,并证明它们均表现出作为正则化函数双下降行为。
引用
@article{arxiv.2206.01378,
title = {Regularization-wise double descent: Why it occurs and how to eliminate it},
author = {Fatih Furkan Yilmaz and Reinhard Heckel},
journal= {arXiv preprint arXiv:2206.01378},
year = {2022}
}
备注
To be published in the 2022 IEEE International Symposium on Information Theory (ISIT) Proceedings