MixUp 作为一种局部线性流形外正则化方法
机器学习
2018-11-26 v3 人工智能
机器学习
摘要
MixUp 是最近提出的一种数据增强方案,它对随机一对训练样本及其标签的 one-hot 表示进行线性插值。使用这些额外数据训练深度神经网络已被证明能够显著提升当前最优方法的预测准确率。然而,MixUp 的功效主要是在经验上确立的,其工作机制与有效性尚未得到深入解释。在本文中,我们将 MixUp 理解为一种“流形外正则化”形式,它在数据流形之外对模型输入空间施加特定的“局部线性”约束。该分析使我们识别出 MixUp 的一个局限,称之为“流形侵入”。简而言之,MixUp 中的流形侵入是一种欠拟合形式,源于混合样本的伪标签与原始训练数据标签之间的冲突。这种现象通常发生在控制混合策略生成的参数未在训练数据上充分微调时。为解决此问题,我们提出了一种新颖的自适应版本 MixUp,其中混合策略通过一个额外的网络和为避免流形侵入而设计的目标函数从数据中自动学习。所提出的正则化器 AdaMixUp 在多个基准数据集上进行了经验评估。大量实验表明,当应用于当前最优的深度分类模型时,AdaMixUp 优于 MixUp。
引用
@article{arxiv.1809.02499,
title = {MixUp as Locally Linear Out-Of-Manifold Regularization},
author = {Hongyu Guo and Yongyi Mao and Richong Zhang},
journal= {arXiv preprint arXiv:1809.02499},
year = {2018}
}
备注
Accepted by AAAI2019