WeMix:如何更好地利用数据增强
机器学习
2020-10-06 v1 计算机视觉与模式识别
最优化与控制
机器学习
摘要
数据增强是深度学习中广泛使用的训练技巧,用于提升网络泛化能力。尽管已有许多令人鼓舞的结果,近期的若干研究确实指出了传统数据增强方案在特定场景下的局限性,呼吁对数据增强有更好的理论理解。在本工作中,我们开展了全面分析,揭示了数据增强的优缺点。数据增强的主要局限性源于数据偏差,即增强后的数据分布可能与原始分布差异很大。这一数据偏差导致现有数据增强方法性能次优。为此,我们提出了两种新算法,称为“AugDrop”和“MixLoss”,以纠正数据增强中的数据偏差。我们的理论分析表明,这两种算法都能通过偏差校正保证改善数据增强的效果,并通过实证研究中得到进一步验证。最后,我们结合 AugDrop 和 MixLoss 提出了通用算法“WeMix”,其有效性在大量实证评估中得到了观察。
引用
@article{arxiv.2010.01267,
title = {WeMix: How to Better Utilize Data Augmentation},
author = {Yi Xu and Asaf Noy and Ming Lin and Qi Qian and Hao Li and Rong Jin},
journal= {arXiv preprint arXiv:2010.01267},
year = {2020}
}