重新审视低标签 regime 下半监督学习的预训练
计算机视觉与模式识别
2022-05-09 v1
摘要
半监督学习(SSL)通过伪标签利用大量无标签数据,以解决标签数据缺乏的问题。然而,在极低标签 regime 下,伪标签可能不正确,即确认偏差,且伪标签反而会损害网络训练。近期研究将基于预训练权重的微调(FT)与 SSL 结合以缓解这些挑战,并声称在低标签 regime 下取得了优越结果。本工作中,我们首先表明 FT 带来的更优预训练权重是取得最优性能的原因,且重要的是,它们对现成的半监督学习器普遍有帮助。我们进一步指出,由于协变量偏移,直接从预训练权重微调是次优的,并提出一个对比目标预训练步骤以使模型权重适配目标数据集。我们通过在分类与分割任务上先进行目标预训练再接半监督微调,开展了大量实验。有前景的结果验证了目标预训练对 SSL 的有效性,尤其在低标签 regime 下。
引用
@article{arxiv.2205.03001,
title = {Revisiting Pretraining for Semi-Supervised Learning in the Low-Label Regime},
author = {Xun Xu and Jingyi Liao and Lile Cai and Manh Cuong Nguyen and Kangkang Lu and Wanyue Zhang and Yasin Yazici and Chuan Sheng Foo},
journal= {arXiv preprint arXiv:2205.03001},
year = {2022}
}