中文

DP-SSL:面向少标注样本鲁棒半监督学习的方法

计算机视觉与模式识别 2021-10-27 v1

摘要

标注数据的稀缺是深度学习的关键障碍。半监督学习(SSL)提供了一种通过伪标签利用无标注数据的前景广阔的途径。然而,当标注数据规模非常小时(例如每类仅少量标注样本),SSL 表现差且不稳定,可能由于所学伪标签质量较低。本文提出一种称为 DP-SSL 的新 SSL 方法,采用创新的数据编程(DP)方案为无标注数据生成概率标签。不同于现有依赖人类专家提供初始标注函数(LFs)的 DP 方法,我们开发了基于多选学习(MCL)的方法,以 SSL 风格从零自动生成 LFs。利用 LFs 产生的噪声标签,我们设计标签模型以解决噪声标签间的冲突与重叠,最终推断无标注样本的概率标签。在四个标准 SSL 基准上的大量实验表明,DP-SSL 能为无标注数据提供可靠标签,并在测试集上取得优于现有 SSL 方法的分类性能,尤其在仅有少量标注样本时。具体而言,对于仅含 40 个标注样本的 CIFAR-10,DP-SSL 在无标注数据上达到 93.82% 标注准确率,在测试数据上达到 93.46% 分类准确率,均高于 SOTA 结果。

关键词

引用

@article{arxiv.2110.13740,
  title  = {DP-SSL: Towards Robust Semi-supervised Learning with A Few Labeled Samples},
  author = {Yi Xu and Jiandong Ding and Lu Zhang and Shuigeng Zhou},
  journal= {arXiv preprint arXiv:2110.13740},
  year   = {2021}
}

备注

Accepted by NeurIPS 2021; 16 pages with appendix