用于解决类不平衡的类难度均衡损失
计算机视觉与模式识别
2020-10-06 v1 人工智能
摘要
类不平衡是真实世界数据集中的主要挑战之一,其中少数类(称为多数类)比其余类(称为少数类)包含多得多的数据样本。使用此类数据集学习深度神经网络导致的性能通常偏向多数类。大多数先前工作试图通过在各种方式下为少数类分配更多权重(例如,数据重采样、代价敏感学习)来解决类不平衡。然而,我们认为可用训练数据的数量可能并非决定加权策略的良好线索,因为某些少数类即使由少量训练数据也可能得到充分表示。对此类样本过度加权会导致模型整体性能下降。我们主张模型所感知的类的“难度”对于确定加权更为重要。有鉴于此,我们提出一种名为类难度均衡损失(CDB loss)的新损失函数,其根据样本所属类的难度动态地为每个样本分配权重。注意所分配权重随模型“难度”可能随学习进程改变而动态变化。我们在图像(人工诱导类不平衡的 MNIST、长尾 CIFAR 和 ImageNet-LT)与视频(EGTEA)数据集上进行了充分实验。结果表明,无论数据类型(即视频或图像),CDB loss 在类不平衡数据集上始终优于近期提出的损失函数。
引用
@article{arxiv.2010.01824,
title = {Class-Wise Difficulty-Balanced Loss for Solving Class-Imbalance},
author = {Saptarshi Sinha and Hiroki Ohashi and Katsuyuki Nakamura},
journal= {arXiv preprint arXiv:2010.01824},
year = {2020}
}
备注
Accepted for ACCV 2020 oral presentation