基于主动对比学习和元伪标签的深度半监督学习协同训练
计算机视觉与模式识别
2025-04-29 v1
摘要
训练深度学习模型的最大挑战之一是准确标注数据稀缺的限制。这一局限在标注耗时且容易出错的领域尤为突出。尽管如此,半监督学习(SSL)通过利用稀缺的标记数据和丰富的未标记数据来应对这一挑战,但最先进的方法通常依赖于预训练特征和大型验证集以学习有效的分类表示。此外,标记数据集常被随机抽取,忽略了对更具信息性样本的选择。本文提出了 active-DeepFA 方法,有效结合了对比学习(CL)、基于教师-学生的元伪标签化和主动学习(AL),用于在标记稀缺且未标记数据丰富的场景下训练非预训练的 CNN 架构进行图像分类。该方法将 DeepFA 集成到协同训练框架中,实现两个协作网络以缓解伪标签的确认偏差。该方法首先通过有监督对比学习对标记样本集进行热身;随后在定期周期内,对网络深层特征的二维投影上进行标签传播。接着,在交叉训练中在网络之间交换最可靠的伪标签,同时对最具意义的样本进行标注并加入标记集。网络独立地最小化由监督对比损失、监督损失和半监督损失三个组成部分构成的目标损失函数,以提升图像分类的特征表示。我们在三个具有挑战性的生物学图像数据集上进行评估,仅使用 5% 的标记样本即可超越基线并击败六种其他最先进方法。此外,该方法通过仅使用 3% 的标记数据即可实现与其它方法相当的效果,显著减少了标注工作量。
引用
@article{arxiv.2504.18666,
title = {Co-Training with Active Contrastive Learning and Meta-Pseudo-Labeling on 2D Projections for Deep Semi-Supervised Learning},
author = {David Aparco-Cardenas and Jancarlo F. Gomes and Alexandre X. Falcão and Pedro J. de Rezende},
journal= {arXiv preprint arXiv:2504.18666},
year = {2025}
}
备注
Submitted to Journal of the Brazilian Computer Society (JBCS) [https://journals-sol.sbc.org.br]