面向长尾识别的标签出现均衡Mixup
计算机视觉与模式识别
2021-10-12 v1
摘要
Mixup是一种流行的数据增强方法,其后相继提出了许多变体。这些方法主要通过随机数据对及其对应one-hot标签的凸组合来创建新样本。然而,它们大多遵循随机采样与混合策略,未考虑混合过程中标签出现的频率。当将mixup应用于长尾数据时,会出现标签抑制问题,即各类别标签出现频率不均衡,且大多数新样本会被完全或部分赋予头部标签。该抑制效应可能进一步加剧数据不平衡问题,并导致尾部类别性能不佳。为解决此问题,我们提出标签出现均衡Mixup(Label-Occurrence-Balanced Mixup),在增强数据的同时保持各类别标签出现在统计上均衡。简而言之,我们采用两个独立的类均衡采样器选取数据对并混合生成新数据。我们在多个长尾视觉与声音识别基准上测试了该方法。实验结果表明,我们的方法显著提升了mixup方法对不平衡数据的适应性,并优于最先进的长尾学习方法。
引用
@article{arxiv.2110.04964,
title = {Label-Occurrence-Balanced Mixup for Long-tailed Recognition},
author = {Shaoyu Zhang and Chen Chen and Xiujuan Zhang and Silong Peng},
journal= {arXiv preprint arXiv:2110.04964},
year = {2021}
}
备注
6 pages, 3 figures