DADA:面向极少量数据场景分类的深度对抗数据增强
计算机视觉与模式识别
2018-09-05 v1
摘要
深度学习已彻底改变了分类任务的性能,但同时也需要充足的标注数据用于训练。在数据不足的情况下,尽管已开发许多技术来帮助对抗过拟合,但若试图训练深度网络,尤其在病态的极少量数据场景下——仅有一小部分标注数据可用,且除此之外一无所有(包括无标注数据)——挑战依然存在。此类场景源于实际情境,其中不仅数据标注昂贵,数据收集本身亦成本高昂。我们提出一种深度对抗数据增强(DADA)技术以应对该问题,其中我们将数据增强精心表述为训练一个类条件且有监督的生成对抗网络(GAN)的问题。具体而言,提出一种新的判别器损失以契合数据增强目标,通过该方法,真实样本与增强样本均被强制对寻找决策边界做出贡献且保持一致。相应地开发了定制训练技术。为定量验证其有效性,我们首先进行大量仿真,表明DADA大幅优于传统数据增强及若干基于GAN的方案。随后我们将实验扩展至三个真实世界小标注数据集,其中现有的数据增强和/或迁移学习策略效果较差或不可行。所有结果均证实了DADA在增强实际极少量数据场景下训练的深度网络泛化能力方面的优越性能。源代码见https://github.com/SchafferZhang/DADA。
引用
@article{arxiv.1809.00981,
title = {DADA: Deep Adversarial Data Augmentation for Extremely Low Data Regime Classification},
author = {Xiaofeng Zhang and Zhangyang Wang and Dong Liu and Qing Ling},
journal= {arXiv preprint arXiv:1809.00981},
year = {2018}
}
备注
15 pages, 5 figures