基于样本有效数量的类平衡损失
计算机视觉与模式识别
2019-01-18 v1
摘要
随着大规模真实世界数据集的迅速增加,解决长尾数据分布(即少数类占据大部分数据,而大多数类代表不足)问题变得至关重要。现有方案通常采用类重平衡策略,例如基于每类观测数量进行重采样与重加权。本文中,我们认为随着样本数量增加,新加入数据点的额外收益会递减。我们引入一种新颖的理论框架,通过将每个样本关联一个小邻域而非单个点来度量数据重叠。样本的有效数量定义为样本的体积,并可由简单公式 计算,其中 为样本数, 为超参数。我们设计了一种重加权方案,利用每类的有效样本数来重平衡损失,从而产生类平衡损失。我们在人工诱导的长尾 CIFAR 数据集以及包括 ImageNet 和 iNaturalist 在内的大规模数据集上进行了全面实验。结果表明,当使用所提出的类平衡损失进行训练时,网络能够在长尾数据集上取得显著的性能提升。
引用
@article{arxiv.1901.05555,
title = {Class-Balanced Loss Based on Effective Number of Samples},
author = {Yin Cui and Menglin Jia and Tsung-Yi Lin and Yang Song and Serge Belongie},
journal= {arXiv preprint arXiv:1901.05555},
year = {2019}
}
备注
Code is available at: https://github.com/richardaecn/class-balanced-loss