DivideMix:将带噪标签学习作为半监督学习
计算机视觉与模式识别
2020-02-20 v1
摘要
深度神经网络以渴求标注而闻名。为降低使用深度网络学习时的标注成本,人们已投入大量努力。两个主要方向包括利用带噪标签学习以及通过挖掘无标签数据进行半监督学习。本工作中,我们提出DivideMix,一种利用半监督学习技术处理带噪标签学习的新型框架。具体而言,DivideMix以混合模型对逐样本损失分布建模,动态将训练数据划分为含干净样本的标签集与含噪声样本的无标签集,并以半监督方式在标签与无标签数据上训练模型。为避免确认偏差,我们同时训练两个发散网络,每个网络使用另一网络的数据划分。在半监督训练阶段,我们通过分别对标签与无标签样本执行标签协同精炼与标签协同猜测来改进MixMatch策略。在多个基准数据集上的实验表明相对最先进方法(SOTA)有实质性提升。代码见https://github.com/LiJunnan1992/DivideMix。
引用
@article{arxiv.2002.07394,
title = {DivideMix: Learning with Noisy Labels as Semi-supervised Learning},
author = {Junnan Li and Richard Socher and Steven C. H. Hoi},
journal= {arXiv preprint arXiv:2002.07394},
year = {2020}
}