中文

DivAug:具有显式多样性最大化的插件式自动化数据增强

计算机视觉与模式识别 2021-08-13 v2

摘要

在过去两年中,人工设计的数据增强策略已被自动学习到的增强策略所取代。具体而言,近期工作通过实证表明,自动化数据增强方法的优越性能源于增强数据多样性的增加\cite{autoaug, randaug}。然而,关于增强数据多样性仍有两方面缺失:1)多样性的明确定义(及相应度量);2)多样性与其正则化效应之间的可量化关系。为弥补这一差距,我们提出一种称为方差多样性(Variance Diversity)的多样性度量,并从理论上证明数据增强的正则化效应由方差多样性所保证。我们在实验中验证,测试准确率上来自自动化数据增强的相对增益与方差多样性高度相关。我们设计了一个无监督的基于采样的框架\textbf{DivAug},用于直接最大化方差多样性,从而增强正则化效应。该框架无需单独的搜索过程,其性能增益与最先进(state-of-the-art)方法相当且效率更高。此外,在半监督设定下,与 RandAugment 相比,我们的框架能进一步提升半监督学习算法的性能,使其在标注数据稀缺的实际问题中具有高度适用性。代码见 \texttt{\url{https://github.com/warai-0toko/DivAug}}。

关键词

引用

@article{arxiv.2103.14545,
  title  = {DivAug: Plug-in Automated Data Augmentation with Explicit Diversity Maximization},
  author = {Zirui Liu and Haifeng Jin and Ting-Hsiang Wang and Kaixiong Zhou and Xia Hu},
  journal= {arXiv preprint arXiv:2103.14545},
  year   = {2021}
}