中文

利用无监督聚类提升半监督学习的性能

计算机视觉与模式识别 2020-12-02 v1 机器学习

摘要

近年来,半监督学习(SSL)在利用少量标注数据的同时借助无标签数据展现出了良好前景。本文表明,在训练过程中间歇性地在完整轮次中完全忽略标签,可以显著提升小样本场景下的性能。更具体地,我们提出联合训练网络完成两项任务:主分类任务同时接触无标签数据与稀缺标注数据,而辅助任务则在不使用任何标签的情况下对数据进行聚类。与自监督中常用的手工设计的 pretext 任务不同,我们的聚类阶段使用相同的分类网络与分类头,以试图放松主任务并在不过拟合标签的前提下传播标签信息。此外,在无监督学习阶段引入了图像旋转分类这一自监督技术以稳定训练。我们证明了所提方法在增强多种最先进 SSL 算法方面的有效性,在标准半监督基准上显著改善其结果并减少运行时间,包括在 CIFAR-10 上达到 92.6% 准确率、在 SVHN 上达到 96.9% 准确率,且每个任务每类仅用 4 个标签。我们还在每类 1、2 和 3 个标签的极端情况下显著提升了结果,并表明我们模型学到的特征对数据分离更具意义。

关键词

引用

@article{arxiv.2012.00504,
  title  = {Boosting the Performance of Semi-Supervised Learning with Unsupervised Clustering},
  author = {Boaz Lerner and Guy Shiran and Daphna Weinshall},
  journal= {arXiv preprint arXiv:2012.00504},
  year   = {2020}
}