通过样本配对进行数据增强的图像分类方法
机器学习
2018-04-12 v2 计算机视觉与模式识别
机器学习
摘要
数据增强是许多机器学习任务(如图像分类)中广泛使用的一项技术,用于虚拟扩大训练数据集规模并避免过拟合。传统的图像分类任务数据增强技术通过对原始图像进行翻转、扭曲、添加少量噪声或裁剪补丁等方式从原始训练数据创建新样本。在本文中,我们介绍了一种简单但出奇有效的图像分类任务数据增强技术。我们的技术名为 SamplePairing,通过将训练数据中随机选择的另一幅图像叠加到一幅图像上(即对每个像素取两幅图像的平均值)来合成新样本。通过使用从训练集中随机选取的两幅图像,我们可以从 N 个训练样本生成 个新样本。这种简单的数据增强技术显著提高了所有被测数据集的分类准确率;例如,使用 GoogLeNet 时,ILSVRC 2012 数据集的 top-1 错误率从33.5%降至29.0%,CIFAR-10 数据集从8.22%降至6.93%。我们还表明,当训练集中的样本数量非常少时,我们的 SamplePairing 技术大幅提高了准确率。因此,我们的技术对于训练数据有限的任务(如医学影像任务)更有价值。
引用
@article{arxiv.1801.02929,
title = {Data Augmentation by Pairing Samples for Images Classification},
author = {Hiroshi Inoue},
journal= {arXiv preprint arXiv:1801.02929},
year = {2018}
}