最小化切比雪夫原型风险以神奇地缓解过拟合危害
机器学习
2024-04-12 v2
摘要
过参数化深度神经网络(DNN)若未得到充分正则化,极易对训练样本过拟合,且难以很好地泛化到测试数据。为了抑制过拟合,研究人员开发了多分量损失函数,以在网络的一层或多层中减小类内特征相关性并最大化类间特征距离。通过分析 DNN 特征提取部分在线性分类器之前输出的倒数第二层特征层激活值,我们发现类内特征协方差和类间原型分离的修正形式是误分类概率的切比雪夫上界的关键组成部分,我们将其称为切比雪夫原型风险(CPR)。以往方法的协方差损失项随网络特征数量呈二次增长,而我们的 CPR 界表明,对数线性时间内的近似协方差损失足以降低该界限,且可扩展至大型架构。我们将 CPR 界的各项纳入显式 CPR(exCPR)损失函数中,并在多个数据集和网络架构上的经验结果表明,我们的训练算法减少了过拟合,且在许多场景下优于以往方法。代码可在 https://github.com/Deano1718/Regularization_exCPR 获取。
引用
@article{arxiv.2404.07083,
title = {Minimizing Chebyshev Prototype Risk Magically Mitigates the Perils of Overfitting},
author = {Nathaniel Dean and Dilip Sarkar},
journal= {arXiv preprint arXiv:2404.07083},
year = {2024}
}
备注
17 pages, 2 figures