理解用于分类的数据增强:何时进行扭曲?
计算机视觉与模式识别
2016-11-29 v2
摘要
本文研究了在训练机器学习分类器时,使用合成创建的样本进行数据增强的益处。创建额外训练样本的两种方法是数据扭曲和合成过采样:前者通过在数据空间中应用变换生成额外样本,后者在特征空间中创建额外样本。我们使用标准的 MNIST 手写数字数据集,实验评估了数据增强对卷积反向传播训练神经网络、卷积支持向量机和卷积极限学习机分类器的益处。我们发现,虽然可以在特征空间中进行通用增强,但如果已知数据的合理变换,那么在数据空间中进行增强在提升性能和减少过拟合方面能提供更大的益处。
引用
@article{arxiv.1609.08764,
title = {Understanding data augmentation for classification: when to warp?},
author = {Sebastien C. Wong and Adam Gatt and Victor Stamatescu and Mark D. McDonnell},
journal= {arXiv preprint arXiv:1609.08764},
year = {2016}
}
备注
6 pages, 6 figures, DICTA 2016 conference