中文

利用全部无标签数据提升半监督学习

计算机视觉与模式识别 2023-03-21 v1

摘要

半监督学习(SSL)因其在缓解对大型标注数据集依赖方面的巨大潜力而备受关注。最新方法(如FixMatch)结合一致性正则化与伪标签取得了显著成功。然而,这些方法均因复杂样本被浪费而受限,因为所有伪标签都必须通过高阈值筛选以滤除噪声。因此,具有模糊预测的样例无法贡献于训练阶段。为更好地利用所有无标签样例,我们提出两种新技术:熵意义损失(EML)与自适应负学习(ANL)。EML将非目标类的预测分布纳入优化目标,以避免与目标类竞争,从而生成更多高置信度预测用于选择伪标签。ANL为所有无标签数据引入额外的负伪标签以利用低置信度样例,它通过动态评估模型的top-k性能自适应地分配该标签。EML与ANL不引入任何额外参数与超参数。我们将这些技术与FixMatch结合,开发出一种简单而强大的框架FullMatch。在多个常见SSL基准(CIFAR-10/100、SVHN、STL-10与ImageNet)上的大量实验表明,FullMatch大幅超越FixMatch。与FlexMatch(一种先进的基于FixMatch的框架)结合后,我们取得了最先进的性能。源代码见https://github.com/megvii-research/FullMatch。

关键词

引用

@article{arxiv.2303.11066,
  title  = {Boosting Semi-Supervised Learning by Exploiting All Unlabeled Data},
  author = {Yuhao Chen and Xin Tan and Borui Zhao and Zhaowei Chen and Renjie Song and Jiajun Liang and Xuequan Lu},
  journal= {arXiv preprint arXiv:2303.11066},
  year   = {2023}
}

备注

Accepted by CVPR 2023