中文

对比以划分:用于带噪标签学习的自监督预训练

计算机视觉与模式识别 2022-02-22 v2 机器学习

摘要

带噪标签学习(LNL)方法的成功高度依赖于预热阶段的成功,该阶段使用完整(含噪)训练集进行标准监督训练。在本文中,我们指出了一个“预热障碍”:标准预热阶段无法训练出高质量特征提取器,也不能避免对噪声标签的过拟合。我们提出“对比以划分”(C2D),一个通过自监督方式预训练特征提取器来解决该问题的简单框架。使用自监督预训练通过大幅降低预热阶段对噪声水平的敏感性、缩短其持续时间并改善提取特征质量,提升了现有 LNL 方法的性能。C2D 可与现有方法开箱即用,并展现出显著改善的性能,尤其在高度噪声情形下,我们在 CIFAR-100 以 90% 噪声下相较先前最优方法获得超过 27% 的提升。在真实噪声设定中,C2D 在 mini-WebVision 上训练,在 WebVision 和 ImageNet 验证集上均以 3% 的 top-1 准确率优于先前工作。我们对该框架进行了深入分析,包括考察不同预训练方法的性能,以及用半监督学习估计 LNL 性能的有效上界。用于复现我们实验的代码见 https://github.com/ContrastToDivide/C2D

关键词

引用

@article{arxiv.2103.13646,
  title  = {Contrast to Divide: Self-Supervised Pre-Training for Learning with Noisy Labels},
  author = {Evgenii Zheltonozhskii and Chaim Baskin and Avi Mendelson and Alex M. Bronstein and Or Litany},
  journal= {arXiv preprint arXiv:2103.13646},
  year   = {2022}
}