基于最优传输的k-Mixup深度学习正则化
机器学习
2023-10-10 v2
摘要
Mixup是一种流行的用于训练深度神经网络的正则化技术,可改善泛化能力并增强对特定分布偏移的鲁棒性。它沿训练集中其他随机选取实例的方向扰动输入训练数据。为更好地利用数据结构,我们以简单且广泛适用的方式将mixup扩展为\emph{-mixup},其沿其他批次的方向扰动批次训练点。该扰动通过位移插值实现,即Wasserstein度量下的插值。我们从理论和仿真上证明-mixup保留聚类和流形结构,并将研究标准mixup有效性的理论扩展到-mixup情形。我们的实证结果表明,在多种网络架构和不同模态的基准数据集上,使用-mixup训练进一步改善了泛化能力和鲁棒性。对于所考虑的各类真实数据集,-mixup相对于标准mixup的性能提升类似于或大于mixup本身相对于标准ERM在超参数优化后的提升。事实上,在若干情况下,-mixup在标准mixup相对于ERM提升可忽略至零的设置中取得了增益。
引用
@article{arxiv.2106.02933,
title = {k-Mixup Regularization for Deep Learning via Optimal Transport},
author = {Kristjan Greenewald and Anming Gu and Mikhail Yurochkin and Justin Solomon and Edward Chien},
journal= {arXiv preprint arXiv:2106.02933},
year = {2023}
}