策略性采样与监督策略对半监督学习的影响
计算机视觉与模式识别
2024-11-05 v2
摘要
在半监督表示学习框架中,当标注数据数量极为稀少时,这些样本的质量与代表性变得愈发重要。现有关于半监督学习的文献随机采样有限数量的数据点进行标注,随后这些标注样本与未标注数据在整个训练过程中一并使用。本文中,我们在此背景下提出两个重要问题:(1)选择哪些样本进行标注是否重要?(2)在整个训练过程中如何与未标注数据一同使用标注样本是否重要?为回答第一个问题,我们探索了多种无监督方法来选择特定数据子集进行标注(无需事先知道其标签),目标是最大化相对于未标注集的代表性。接着,针对第二个问题,我们定义了训练过程中多种不同的标签注入策略。在 CIFAR-10、CIFAR-100、SVHN 和 STL-10 四个流行数据集上的大量实验表明,相较于采用随机样本标注的现有半监督框架(如 MixMatch、ReMixMatch、FixMatch 等),无监督地选择更能代表整体数据的样本可将性能提升高达约 2%。我们显示,在极少标注场景下这一提升甚至可达 7.5%。然而,我们的研究表明,与在整个训练过程中始终使用所有已有标签相比,在训练过程中逐步注入标签并不会对性能产生显著影响。
引用
@article{arxiv.2211.14912,
title = {Impact of Strategic Sampling and Supervision Policies on Semi-supervised Learning},
author = {Shuvendu Roy and Ali Etemad},
journal= {arXiv preprint arXiv:2211.14912},
year = {2024}
}
备注
Accepted in IEEE Transactions on Emerging Topics in Computational Intelligence (TETCI)