中文

迈向真实半监督学习

计算机视觉与模式识别 2022-07-29 v2 机器学习

摘要

深度学习正在推动许多计算机视觉应用的最先进水平。然而,它依赖于大型标注数据库,且捕捉真实世界数据的无约束本质尚待解决。半监督学习(SSL)以大量未标注数据补充标注训练数据,以降低标注成本。标准 SSL 方法假设未标注数据与标注数据来自相同分布。近来,一种更真实的 SSL 问题被提出,称为开放世界 SSL,其中未标注数据可能包含来自未知类的样本。在本文中,我们提出一种基于伪标签的新方法来解决开放世界设置下的 SSL。我们方法的核心是利用样本不确定性并融入关于类分布的先验知识,为属于已知和未知类的未标注数据生成可靠的类分布感知伪标签。我们的大量实验展示了我们的方法在多个基准数据集上的有效性,其在七个多样数据集上大幅优于现有最先进水平,包括 CIFAR-100(约 17%)、ImageNet-100(约 5%)和 Tiny ImageNet(约 9%)。我们还强调了我们的方法在解决新类发现任务中的灵活性,展示了其在处理不平衡数据时的稳定性,并以一种估计新类数量的技术补充了我们的方法。

关键词

引用

@article{arxiv.2207.02269,
  title  = {Towards Realistic Semi-Supervised Learning},
  author = {Mamshad Nayeem Rizve and Navid Kardan and Mubarak Shah},
  journal= {arXiv preprint arXiv:2207.02269},
  year   = {2022}
}

备注

Accepted to ECCV 2022 (Oral)