中文

缓解实例依赖标签噪声:融合自监督预训练与伪标签精化

计算机视觉与模式识别 2024-12-09 v1 机器学习

摘要

深度学习模型严重依赖大量标注数据以实现高性能。然而,真实世界数据集常因人工错误、模糊性或标注过程中的资源限制而包含噪声标签。实例依赖标签噪声 (IDN) 指标签被污染的概率依赖于输入特征,由于其更普遍且更难处理,构成了重大挑战。本文提出一种新型混合框架,将使用 SimCLR 的自监督学习与迭代伪标签精化相结合,以缓解 IDN 的影响。自监督预训练阶段使模型无需依赖可能有噪声的标签即可学习鲁棒的特征表示,建立与噪声无关的基础。随后,我们采用迭代训练与伪标签精化过程,通过多阶段方法识别高置信度预测样本,并逐步更新其标签以提升标签质量。我们在 CIFAR-10 和 CIFAR-100 数据集上进行了评估,并注入了不同噪声水平的合成实例依赖噪声。实验结果表明,我们的方法显著优于多种最先进方法,特别是在高噪声条件下,在分类准确率和鲁棒性方面取得了显著提升。我们的发现表明,将自监督学习与迭代伪标签精化相结合,是训练深度神经网络应对实例依赖标签噪声数据集的有效策略。

关键词

引用

@article{arxiv.2412.04898,
  title  = {Mitigating Instance-Dependent Label Noise: Integrating Self-Supervised Pretraining with Pseudo-Label Refinement},
  author = {Gouranga Bala and Anuj Gupta and Subrat Kumar Behera and Amit Sethi},
  journal= {arXiv preprint arXiv:2412.04898},
  year   = {2024}
}