中文

重新审视类别不平衡半监督学习中的重采样

计算机视觉与模式识别 2021-12-14 v2

摘要

半监督学习(SSL)在标注数据稀缺时已展现出利用无标注数据的强大能力。然而,大多数SSL算法建立在训练集与测试集中类别分布均平衡的假设之下。在本工作中,我们考虑类别不平衡数据上的SSL问题,这更能反映真实世界情形。具体而言,我们将表征与分类器的训练解耦,并系统研究在训练包含分类器的整个网络以及仅微调特征提取器时,不同数据重采样技术的影响。我们发现数据重采样对学习良好分类器至关重要,因其提升了伪标签的准确性,尤其针对无标注数据中的少数类。有趣的是,我们发现准确的伪标签在训练特征提取器时并无帮助,相反,数据重采样损害了特征提取器的训练。该发现违背了“错误伪标签总会损害SSL模型性能”的普遍直觉。基于这些发现,我们建议重新思考当前采用单一数据重采样策略的范式,并针对类别不平衡数据上的SSL开发了一种简单却高度有效的双采样(BiS)策略。BiS为训练特征提取器与分类器实施两种不同的重采样策略,并将此解耦训练整合进端到端框架。特别地,BiS在训练过程中逐步改变数据分布,使得初期特征提取器被有效训练,而在训练末期数据被重新平衡以可靠地训练分类器。我们在流行数据集上广泛基准测试了所提双采样策略,并取得了SOTA性能。

关键词

引用

@article{arxiv.2106.00209,
  title  = {Rethinking Re-Sampling in Imbalanced Semi-Supervised Learning},
  author = {Ju He and Adam Kortylewski and Shaokang Yang and Shuai Liu and Cheng Yang and Changhu Wang and Alan Yuille},
  journal= {arXiv preprint arXiv:2106.00209},
  year   = {2021}
}