SimPLE:用于半监督分类的相似伪标签利用
计算机视觉与模式识别
2022-07-01 v2 机器学习
摘要
一种常见的分类任务情形是拥有大量可用于训练的数据,但仅有小部分标注了类别标签。在此背景下,半监督训练的目标是通过利用来自标注数据以及大量未标注数据的信息来提升分类准确率。近期工作通过探索不同增强的标注与未标注数据之间的一致性约束取得了显著改进。沿此路径,我们提出了一种新颖的无监督目标,聚焦于彼此相似的高置信度未标注数据之间较少被研究的关系。所提出的 Pair Loss 最小化相似度高于某一阈值的高置信度伪标签之间的统计距离。将 Pair Loss 与 MixMatch 系列所发展的技术结合,我们提出的 SimPLE 算法在 CIFAR-100 与 Mini-ImageNet 上相较先前算法表现出显著性能提升,并在 CIFAR-10 与 SVHN 上与最先进方法持平。此外,SimPLE 在迁移学习设定下也优于最先进方法,其中模型由在 ImageNet 或 DomainNet-Real 上预训练的权重初始化。代码见 github.com/zijian-hu/SimPLE。
引用
@article{arxiv.2103.16725,
title = {SimPLE: Similar Pseudo Label Exploitation for Semi-Supervised Classification},
author = {Zijian Hu and Zhengyu Yang and Xuefeng Hu and Ram Nevatia},
journal= {arXiv preprint arXiv:2103.16725},
year = {2022}
}
备注
Accepted to CVPR 2021. First two authors contributed equally