中文

开放集半监督学习中未标注数据的探索与利用

计算机视觉与模式识别 2023-07-03 v1

摘要

在本文中,我们处理半监督学习(SSL)中一个复杂但实际的场景,称为开放集SSL,其中未标注数据同时包含分布内(ID)和分布外(OOD)样本。与以往仅考虑ID样本有用并在训练中完全滤除OOD样本的方法不同,我们认为对ID和OOD样本的探索与利用均有益于SSL。为支持我们的主张,i) 我们提出了一种基于原型的聚类与识别算法,该算法在特征层面探索样本间固有的相似性与差异性,并将它们有效聚类于若干预定义的ID和OOD原型周围,从而增强特征学习并促进ID/OOD识别;ii) 我们提出了一种基于重要性的采样方法,该方法利用了各ID和OOD样本对SSL重要性的差异,从而减少采样偏差并改进训练。我们提出的方法在多个具有挑战性的基准上达到了最先进(state-of-the-art)水平,且即使未标注数据中完全不含ID样本,也优于现有SSL方法。

关键词

引用

@article{arxiv.2306.17699,
  title  = {Exploration and Exploitation of Unlabeled Data for Open-Set Semi-Supervised Learning},
  author = {Ganlong Zhao and Guanbin Li and Yipeng Qin and Jinjin Zhang and Zhenhua Chai and Xiaolin Wei and Liang Lin and Yizhou Yu},
  journal= {arXiv preprint arXiv:2306.17699},
  year   = {2023}
}