中文

开放世界半监督学习

机器学习 2022-01-27 v3 计算机视觉与模式识别

摘要

在真实场景中应用半监督学习的一个基本局限在于其假设未标记测试数据仅包含标记训练数据中先前遇到的类别。然而,对于野外部署的数据,这一假设很少成立,因为属于新颖类别的实例可能在测试时出现。在此,我们引入一种新颖的开放世界半监督学习设定,将未标记测试数据中可能出现新颖类别的概念形式化。在这一新设定下,目标是解决标记与未标记数据之间的类别分布失配,即在测试时每个输入实例要么需要被分类到现有类别之一,要么需要初始化一个新的未见类别。为应对这一挑战性问题,我们提出 ORCA,一种端到端深度学习方法,引入不确定性自适应间隔机制,以规避因对已知类别的特征学习快于新颖类别而导致的对已知类的偏向。通过这种方式,ORCA 缩小了已知类与新颖类之间类内方差的差距。在图像分类数据集和单细胞注释数据集上的实验表明,ORCA 持续优于替代基线,在 ImageNet 数据集上已知类提升 25%、新颖类提升 96%。

关键词

引用

@article{arxiv.2102.03526,
  title  = {Open-World Semi-Supervised Learning},
  author = {Kaidi Cao and Maria Brbic and Jure Leskovec},
  journal= {arXiv preprint arXiv:2102.03526},
  year   = {2022}
}