高斯混合的二分类:支持向量的丰富性、良性过拟合与正则化
机器学习
2021-09-16 v4 机器学习
统计理论
统计理论
摘要
深度神经网络尽管参数极度过剩且训练时无需显式正则化,却仍能很好地泛化。这一奇特现象激发了大量研究活动以确立其统计原理:在何种条件下观察到它?这些如何依赖于数据与训练算法?正则化何时有益于泛化?尽管此类问题对深度神经网络仍远未解决,近期工作试图通过研究更简单的(通常为线性的)模型来获取见解。我们的论文通过考察生成式高斯混合模型下的二元线性分类,对这条日益增长的研究线做出贡献。受近期关于梯度下降隐式偏置结果的启发,我们研究了最大间隔 SVM 分类器(对应 logistic 损失)与最小范数插值分类器(对应最小二乘损失)。首先,我们利用 [V. Muthukumar 等人, arXiv:2005.08054, (2020)] 中引入的思想,将 SVM 解与最小范数插值解相关联。其次,我们推导了后者分类误差的新颖非渐近界。结合两者,我们给出了关于协方差谱与信噪比(SNR)的新颖充分条件,在此条件下插值估计量随着过参数化增加而达到渐近最优性能。有趣的是,我们的结果扩展到具有恒定概率噪声翻转的噪声模型。与先前研究的判别数据模型相反,我们的结果强调了 SNR 的关键作用及其与数据协方差的相互作用。最后,通过解析论证与数值演示的结合,我们确定了插值估计量优于相应正则化估计量的条件。
引用
@article{arxiv.2011.09148,
title = {Binary Classification of Gaussian Mixtures: Abundance of Support Vectors, Benign Overfitting and Regularization},
author = {Ke Wang and Christos Thrampoulidis},
journal= {arXiv preprint arXiv:2011.09148},
year = {2021}
}
备注
New results: Extensions to model with label noise