中文

DualAug:利用分布外数据拒绝发掘额外强增强

计算机视觉与模式识别 2023-10-17 v2

摘要

数据增强是减少模型过拟合并提升泛化能力的主要方法。大多数现有数据增强方法倾向于在增强数据中寻求折中,即谨慎增大增强幅度以避免某些数据被过度破坏而损害模型性能。我们深入探究数据增强与模型性能的关系,揭示强增强带来的性能下降源于分布外(OOD)数据的出现。然而,由于同一数据变换对不同训练样本效果不同,即便强增强,仍存在部分有益模型训练的分布内数据。基于该观察,我们提出一种名为DualAug的新颖数据增强方法,以合理的时间与计算成本尽可能保持增强处于分布内。我们设计了一种数据混合策略,融合来自基础增强分支与强增强分支的增强数据。在监督图像分类基准上的大量实验表明,DualAug改进了多种自动化数据增强方法。此外,半监督学习与对比自监督学习实验表明我们的DualAug也能改进相关方法。代码见 \href{https://github.com/shuguang99/DualAug}{https://github.com/shuguang99/DualAug}。

关键词

引用

@article{arxiv.2310.08139,
  title  = {DualAug: Exploiting Additional Heavy Augmentation with OOD Data Rejection},
  author = {Zehao Wang and Yiwen Guo and Qizhang Li and Guanglei Yang and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2310.08139},
  year   = {2023}
}

备注

14 pages, 6 figures