使用 Mixup 的过度训练可能损害泛化能力
机器学习
2023-03-03 v1
摘要
Mixup 通过对随机样本对进行线性插值来创建合成训练样本,是一种简单而有效的正则化技术,可提升使用 SGD 训练的深度模型性能。在本工作中,我们报告了 Mixup 训练中一个此前未被观察到的现象:在多个标准数据集上,Mixup 训练模型在训练大量轮次后性能开始下降,产生 U 形泛化曲线。当原始数据集规模减小时,该行为进一步加剧。为帮助理解 Mixup 的这种行为,我们从理论上证明 Mixup 训练可能向合成数据引入不期望的依赖于数据的标签噪声。通过分析带随机特征模型的最小二乘回归问题,我们解释了为何噪声标签可能导致 U 形曲线出现:Mixup 在训练早期通过拟合干净模式改善泛化,但随着训练推进,Mixup 变得对合成数据中的噪声过拟合。我们在多种基准数据集上进行了大量实验,验证了该解释。
引用
@article{arxiv.2303.01475,
title = {Over-training with Mixup May Hurt Generalization},
author = {Zixuan Liu and Ziqiao Wang and Hongyu Guo and Yongyi Mao},
journal= {arXiv preprint arXiv:2303.01475},
year = {2023}
}
备注
Accepted to ICLR 2023