学习组合领域特定变换用于数据增强
机器学习
2018-12-10 v3 计算机视觉与模式识别
机器学习
摘要
数据增强是一种普遍的技术,通过利用保持类标签的任务特定数据变换来扩大标记训练集的规模。虽然领域专家指定单个变换通常很容易,但构建和调整通常达到最先进结果所需的更复杂组合在实践中是一项耗时的手动任务。我们提出一种方法,通过使用生成对抗方法在用户指定的变换函数上学习生成序列模型来自动化这一过程。我们的方法可以利用任意非确定性变换函数,对错误指定的用户输入具有鲁棒性,并且在无标签数据上训练。学习到的变换模型随后可用于任何终端判别模型的数据增强。在我们的实验中,我们展示了我们的方法在图像和文本数据集上的功效,与标准启发式增强方法相比,在CIFAR-10上准确率提高4.0个百分点,在ACE关系抽取任务上F1提高1.4个百分点,以及在医学图像数据集上使用领域特定变换操作时准确率提高3.4个百分点。
引用
@article{arxiv.1709.01643,
title = {Learning to Compose Domain-Specific Transformations for Data Augmentation},
author = {Alexander J. Ratner and Henry R. Ehrenberg and Zeshan Hussain and Jared Dunnmon and Christopher Ré},
journal= {arXiv preprint arXiv:1709.01643},
year = {2018}
}
备注
To appear at Neural Information Processing Systems (NIPS) 2017