中文

多样本 $\zeta$-mixup:基于 $p$-级数插值器的更丰富、更真实合成样本

机器学习 2022-04-08 v1 计算机视觉与模式识别

摘要

现代深度学习训练过程依赖于模型正则化技术,例如数据增强方法,其生成的训练样本增加了数据的多样性和标签信息的丰富性。最近一种流行的方法 mixup 使用原始样本对的凸组合来生成新样本。然而,正如我们在实验中展示的,mixup 可能产生不理想的合成样本,其中数据采样自流形之外且可能包含错误标签。我们提出 ζ\zeta-mixup,它是 mixup 的推广,具有可证明且可展示的理想性质,允许 N2N \geq 2 个样本的凸组合,通过使用 pp-级数插值器产生更真实和多样的、融合 NN 个原始样本信息的输出。我们表明,与 mixup 相比,ζ\zeta-mixup 更好地保留了原始数据集的内在维度,这是训练可泛化模型的一个理想性质。此外,我们表明我们对 ζ\zeta-mixup 的实现比 mixup 更快,并且在受控合成数据和 24 个真实世界自然与医学图像分类数据集上的广泛评估表明,ζ\zeta-mixup 优于 mixup 和传统数据增强技术。

关键词

引用

@article{arxiv.2204.03323,
  title  = {Multi-Sample $\zeta$-mixup: Richer, More Realistic Synthetic Samples from a $p$-Series Interpolant},
  author = {Kumar Abhishek and Colin J. Brown and Ghassan Hamarneh},
  journal= {arXiv preprint arXiv:2204.03323},
  year   = {2022}
}

备注

21 pages, 5 figures