开放集半监督学习中未标注数据的探索与利用
计算机视觉与模式识别
2023-07-03 v1
摘要
在本文中,我们处理半监督学习(SSL)中一个复杂但实际的场景,称为开放集SSL,其中未标注数据同时包含分布内(ID)和分布外(OOD)样本。与以往仅考虑ID样本有用并在训练中完全滤除OOD样本的方法不同,我们认为对ID和OOD样本的探索与利用均有益于SSL。为支持我们的主张,i) 我们提出了一种基于原型的聚类与识别算法,该算法在特征层面探索样本间固有的相似性与差异性,并将它们有效聚类于若干预定义的ID和OOD原型周围,从而增强特征学习并促进ID/OOD识别;ii) 我们提出了一种基于重要性的采样方法,该方法利用了各ID和OOD样本对SSL重要性的差异,从而减少采样偏差并改进训练。我们提出的方法在多个具有挑战性的基准上达到了最先进(state-of-the-art)水平,且即使未标注数据中完全不含ID样本,也优于现有SSL方法。
引用
@article{arxiv.2306.17699,
title = {Exploration and Exploitation of Unlabeled Data for Open-Set Semi-Supervised Learning},
author = {Ganlong Zhao and Guanbin Li and Yipeng Qin and Jinjin Zhang and Zhenhua Chai and Xiaolin Wei and Liang Lin and Yizhou Yu},
journal= {arXiv preprint arXiv:2306.17699},
year = {2023}
}