mixup 何时促进所学表征中的局部线性?
机器学习
2022-11-01 v1
摘要
Mixup 是一种正则化技术,它使用原始训练点的凸组合人为生成新样本。这一简单技术已展现出强劲的经验性能,并作为 mixmatch~\citep{berthelot2019mixmatch} 和插值一致训练(ICT)~\citep{verma2019interpolation} 等半监督学习技术的重要组成部分而被大量使用。在本文中,我们从表征学习的视角在半监督学习设置下审视 Mixup。具体而言,我们研究 Mixup 在促进所学网络表征线性方面的作用。为此,我们研究两个问题:(1)在最后网络层强制线性的 Mixup 损失如何将线性传播到更早的层?;以及(2)对多于两个数据点强制更强的 Mixup 损失如何影响训练的收敛?我们在 CIFAR-10、CIFAR-100 和 SVHN 等视觉数据集上经验性地研究了 Mixup 的这些性质。我们的结果表明,有监督的 Mixup 训练并不会使所有网络层都线性化;事实上,与未经 Mixup 训练的网络相比,中间层在 Mixup 训练期间变得更具非线性。然而,当 Mixup 被用作无监督损失时,我们观察到所有网络层都变得更线性,从而带来更快的训练收敛。
引用
@article{arxiv.2210.16413,
title = {When does mixup promote local linearity in learned representations?},
author = {Arslan Chaudhry and Aditya Krishna Menon and Andreas Veit and Sadeep Jayasumana and Srikumar Ramalingam and Sanjiv Kumar},
journal= {arXiv preprint arXiv:2210.16413},
year = {2022}
}