LayerMatch:伪标签是否惠及所有层?
机器学习
2024-06-28 v3
摘要
深度神经网络在获得大规模标记数据后,在各种任务上取得了显著的性能。然而,标记数据的收集可能既耗时又费力。半监督学习(SSL),特别是通过伪标签算法实现的自训练,为缓解标记数据依赖性提供了有前景的解决方案。以往的研究通常对所有模型层应用统一的伪标签策略,假设伪标签在整个模型中施加均匀影响。与此相反,我们的理论分析和实证实验表明,特征提取层和线性分类层对伪标签的学习行为存在差异。基于这些洞见,我们开发了两种层特定的伪标签策略,称为 Grad-ReLU 和 Avg-Clustering。Grad-ReLU 通过消除线性分类层中伪标签有害梯度效应来减轻噪声伪标签的影响。Avg-Clustering 通过整合一致的输出来加速特征提取层对稳定聚类中心的收敛。我们的方法 LayerMatch 将这两种策略集成在一起,既能避免噪声伪标签在线性分类层中的严重干扰,又能加快特征提取层的聚类能力。在大量实验中,我们的方法在标准半监督学习基准测试上始终表现出色,相对于基线方法实现了约 10.38% 的显著提升,相对于最新方法实现了约 2.44% 的提升。
引用
@article{arxiv.2406.14207,
title = {LayerMatch: Do Pseudo-labels Benefit All Layers?},
author = {Chaoqi Liang and Guanglei Yang and Lifeng Qiao and Zitong Huang and Hongliang Yan and Yunchao Wei and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2406.14207},
year = {2024}
}