带噪声学生的自训练改进ImageNet分类
机器学习
2020-06-22 v4 计算机视觉与模式识别
机器学习
摘要
我们提出Noisy Student Training,一种即使在标注数据丰富时也表现良好的半监督学习方法。Noisy Student Training在ImageNet上达到了88.4%的top-1准确率,比需要35亿张弱标注Instagram图像的最先进模型高出2.0%。在鲁棒性测试集上,它将ImageNet-A的top-1准确率从61.0%提升到83.7%,将ImageNet-C平均损坏误差从45.7降至28.3,并将ImageNet-P平均翻转率从27.8降至12.2。Noisy Student Training扩展了自训练与蒸馏的思想,使用了相等或更大的学生模型,并在学习过程中向学生添加噪声。在ImageNet上,我们首先在标注图像上训练一个EfficientNet模型,并将其作为教师为3亿张无标注图像生成伪标签。然后我们在标注与伪标注图像的组合上训练一个更大的EfficientNet作为学生模型。我们通过将学生放回作为教师来迭代此过程。在学习学生时,我们通过RandAugment向学生注入如dropout、随机深度和数据增强等噪声,使学生比教师泛化得更好。模型可在https://github.com/tensorflow/tpu/tree/master/models/official/efficientnet获取。代码可在https://github.com/google-research/noisystudent获取。
引用
@article{arxiv.1911.04252,
title = {Self-training with Noisy Student improves ImageNet classification},
author = {Qizhe Xie and Minh-Thang Luong and Eduard Hovy and Quoc V. Le},
journal= {arXiv preprint arXiv:1911.04252},
year = {2020}
}
备注
CVPR 2020