中文

用于神经网络训练的数据高效增强

机器学习 2023-07-21 v3

摘要

数据增强对于在许多深度学习应用中达到最优性能至关重要。然而,最有效的增强技术即使对于中等规模的数据集也变得计算上难以承受。为此,我们提出一种严谨的技术,用于选择数据点子集,这些子集在增强后能够紧密捕捉完整数据增强的训练动态。我们首先表明,建模为加性扰动的数据增强,通过相对放大和扰动网络 Jacobian 的较小奇异值,同时保留其主要方向,从而改善学习和泛化。这防止了过拟合并增强了对更难学习信息的学习。然后,我们提出一个框架,迭代地提取训练数据的小子集,这些子集在增强后能够紧密捕捉完全增强 Jacobian 与标签/残差的对齐。我们证明,对我们方法找到的增强子集应用随机梯度下降,其训练动态与完全增强数据相似。我们的实验表明,我们的方法在 CIFAR10 上实现 6.3 倍加速,在 SVHN 上实现 2.2 倍加速,并在各种子集大小下比基线高出多达 10%。类似地,在 TinyImageNet 和 ImageNet 上,我们的方法比基线高出多达 8%,同时在各种子集大小下实现多达 3.3 倍加速。最后,在带有标签噪声损坏的 CIFAR10 版本上,使用我们的方法训练和增强 50% 子集甚至优于使用完整数据集。我们的代码可在 https://github.com/tianyu139/data-efficient-augmentation 获取。

关键词

引用

@article{arxiv.2210.08363,
  title  = {Data-Efficient Augmentation for Training Neural Networks},
  author = {Tian Yu Liu and Baharan Mirzasoleiman},
  journal= {arXiv preprint arXiv:2210.08363},
  year   = {2023}
}

备注

Code available at: https://github.com/tianyu139/data-efficient-augmentation