中文

基于最优传输的k-Mixup深度学习正则化

机器学习 2023-10-10 v2

摘要

Mixup是一种流行的用于训练深度神经网络的正则化技术,可改善泛化能力并增强对特定分布偏移的鲁棒性。它沿训练集中其他随机选取实例的方向扰动输入训练数据。为更好地利用数据结构,我们以简单且广泛适用的方式将mixup扩展为\emph{kk-mixup},其沿其他kk批次的方向扰动kk批次训练点。该扰动通过位移插值实现,即Wasserstein度量下的插值。我们从理论和仿真上证明kk-mixup保留聚类和流形结构,并将研究标准mixup有效性的理论扩展到kk-mixup情形。我们的实证结果表明,在多种网络架构和不同模态的基准数据集上,使用kk-mixup训练进一步改善了泛化能力和鲁棒性。对于所考虑的各类真实数据集,kk-mixup相对于标准mixup的性能提升类似于或大于mixup本身相对于标准ERM在超参数优化后的提升。事实上,在若干情况下,kk-mixup在标准mixup相对于ERM提升可忽略至零的设置中取得了增益。

关键词

引用

@article{arxiv.2106.02933,
  title  = {k-Mixup Regularization for Deep Learning via Optimal Transport},
  author = {Kristjan Greenewald and Anming Gu and Mikhail Yurochkin and Justin Solomon and Edward Chien},
  journal= {arXiv preprint arXiv:2106.02933},
  year   = {2023}
}