重新评估未见类别无标签数据对半监督学习模型的影响
机器学习
2025-03-04 v1
摘要
半监督学习(SSL)有效地利用无标签数据,并已在 various 领域取得成功。当前安全的 SSL 方法认为,无标签数据中的未见类别会损害 SSL 模型的性能。然而,之前用于评估未见类别对 SSL 模型性能影响的方法存在缺陷。它们固定无标签数据集的大小,并调整无标签数据中未见类别的比例来评估影响。这一过程违反了控制变量的原则。调整无标签数据中未见类别的比例会改变未见类别的比例,这意味着未见类别样本增加导致的分类性能下降,可能并非源于未见类别样本的增加,而是源于未见类别样本的减少。因此,先前的错误评估标准——“无标签数据中的未见类别会损害 SSL 模型性能”——可能并不总是成立。本文严格遵循控制变量原则,维持无标签数据中未见类别的比例仅改变未见类别,从而在全局鲁棒性和局部鲁棒性方面考察它们对 SSL 模型的影响。实验表明,无标签数据中的未见类别并不必然损害 SSL 模型的性能;事实上,在某些条件下,未见类别甚至可能提升它们的性能。
引用
@article{arxiv.2503.00884,
title = {Re-Evaluating the Impact of Unseen-Class Unlabeled Data on Semi-Supervised Learning Model},
author = {Rundong He and Yicong Dong and Lanzhe Guo and Yilong Yin and Tailin Wu},
journal= {arXiv preprint arXiv:2503.00884},
year = {2025}
}
备注
Published as a conference paper at ICLR 2025