中文

面向长尾数据的特征空间增强

计算机视觉与模式识别 2020-08-11 v1

摘要

真实世界的数据通常遵循长尾分布,因为每个类的频率通常不同。例如,一个数据集可能包含大量代表性不足的类,以及少数拥有充足数据的类。然而,用于表示数据集的模型通常期望在各个类上具有相当均衡的性能。引入类平衡损失以及数据重采样与增强方面的先进方法是缓解数据不平衡问题的最佳实践之一。然而,关于代表性不足类的另一部分问题将不得不依赖额外知识来恢复缺失信息。在本工作中,我们提出一种新方法,通过在特征空间中利用从样本充足的类学到的特征来增强代表性不足的类,从而解决长尾问题。具体而言,我们使用类激活图将每个类的特征分解为类通用分量和类特定分量。随后,在训练阶段通过将从代表性不足类提取的类特定特征与来自易混淆类的类通用特征相融合,动态生成代表性不足类的新样本。我们在 iNaturalist、ImageNet-LT、Places-LT 以及长尾版 CIFAR 等不同数据集上的结果表明了当前最优性能。

关键词

引用

@article{arxiv.2008.03673,
  title  = {Feature Space Augmentation for Long-Tailed Data},
  author = {Peng Chu and Xiao Bian and Shaopeng Liu and Haibin Ling},
  journal= {arXiv preprint arXiv:2008.03673},
  year   = {2020}
}

备注

To be appeared in ECCV 2020