中文

数据增强的好、坏与丑:隐式谱正则化视角

机器学习 2024-02-29 v3 机器学习

摘要

数据增强(DA)是提升现代机器学习性能的强大主力。计算机视觉中特定的增强(如平移和缩放)传统上被认为通过从同一分布生成新(人工)数据来改善泛化能力。然而,这种传统观点无法解释现代机器学习中普遍使用的增强(例如随机掩码、cutout、mixup)的成功,这些增强极大地改变了训练数据分布。在这项工作中,我们开发了一个新的理论框架,以刻画一般 DA 类别对欠参数化和过参数化线性模型泛化能力的影响。我们的框架揭示了 DA 通过两种不同效应的结合诱导了隐式谱正则化:a) 以依赖训练数据的方式操纵数据协方差矩阵特征值的相对比例,以及 b) 通过岭回归均匀提升数据协方差矩阵的整个谱。这些效应在应用于流行的增强时,产生了广泛的现象,包括过参数化与欠参数化机制之间泛化能力的差异,以及回归与分类任务之间的差异。我们的框架突出了 DA 对泛化的细微且有时令人惊讶的影响,并可作为新增强设计的测试平台。

关键词

引用

@article{arxiv.2210.05021,
  title  = {The good, the bad and the ugly sides of data augmentation: An implicit spectral regularization perspective},
  author = {Chi-Heng Lin and Chiraag Kaushik and Eva L. Dyer and Vidya Muthukumar},
  journal= {arXiv preprint arXiv:2210.05021},
  year   = {2024}
}

备注

72 pages, 8 figures