多样本 $\zeta$-mixup:基于 $p$-级数插值器的更丰富、更真实合成样本
机器学习
2022-04-08 v1 计算机视觉与模式识别
摘要
现代深度学习训练过程依赖于模型正则化技术,例如数据增强方法,其生成的训练样本增加了数据的多样性和标签信息的丰富性。最近一种流行的方法 mixup 使用原始样本对的凸组合来生成新样本。然而,正如我们在实验中展示的,mixup 可能产生不理想的合成样本,其中数据采样自流形之外且可能包含错误标签。我们提出 -mixup,它是 mixup 的推广,具有可证明且可展示的理想性质,允许 个样本的凸组合,通过使用 -级数插值器产生更真实和多样的、融合 个原始样本信息的输出。我们表明,与 mixup 相比,-mixup 更好地保留了原始数据集的内在维度,这是训练可泛化模型的一个理想性质。此外,我们表明我们对 -mixup 的实现比 mixup 更快,并且在受控合成数据和 24 个真实世界自然与医学图像分类数据集上的广泛评估表明,-mixup 优于 mixup 和传统数据增强技术。
引用
@article{arxiv.2204.03323,
title = {Multi-Sample $\zeta$-mixup: Richer, More Realistic Synthetic Samples from a $p$-Series Interpolant},
author = {Kumar Abhishek and Colin J. Brown and Ghassan Hamarneh},
journal= {arXiv preprint arXiv:2204.03323},
year = {2022}
}
备注
21 pages, 5 figures