中文

从自然不平衡的伪标签中进行去偏学习

机器学习 2022-04-22 v2 计算与语言 计算机视觉与模式识别

摘要

伪标签是由在带标签源数据上训练的分类器对无标签目标数据做出的高置信度预测。它们被广泛用于使模型适应无标签数据,例如在半监督学习设置中。我们的核心见解是:即使模型在平衡的源数据上训练并在平衡的目标数据上评估,由于内在的数据相似性,伪标签自然是不平衡的。如果我们解决这一由伪标签而非真实训练标签引起的先前未知的不平衡分类问题,就能消除伪标签所创造的针对虚假多数的模型偏置。我们基于反事实推理和自适应边界,提出了一种新颖有效的伪标签去偏学习方法:前者消除分类器响应偏置,后者根据伪标签的不平衡调整每类的边界。经大量实验验证,我们简单的去偏学习在ImageNet-1K上相比最先进水平取得了显著的准确率提升:在标注率0.2%的半监督学习中提升26%,在零样本学习中提升9%。我们的代码可在以下地址获取:https://github.com/frank-xwang/debiased-pseudo-labeling。

关键词

引用

@article{arxiv.2201.01490,
  title  = {Debiased Learning from Naturally Imbalanced Pseudo-Labels},
  author = {Xudong Wang and Zhirong Wu and Long Lian and Stella X. Yu},
  journal= {arXiv preprint arXiv:2201.01490},
  year   = {2022}
}

备注

Accepted by CVPR 2022