Mean Teacher 是更好的榜样:权重平均一致性目标改进半监督深度学习结果
神经与进化计算
2018-04-17 v6 机器学习
机器学习
摘要
最近提出的 Temporal Ensembling 在多个半监督学习基准上取得了最先进的结果。它为每个训练样本维护标签预测的指数移动平均,并惩罚与该目标不一致的预测。然而,由于目标每个 epoch 仅改变一次,Temporal Ensembling 在学习大型数据集时变得难以处理。为克服此问题,我们提出 Mean Teacher,一种平均模型权重而非标签预测的方法。作为额外优势,Mean Teacher 提高了测试精度,并使得训练所需标签比 Temporal Ensembling 更少。在不改变网络架构的情况下,Mean Teacher 在 SVHN 上使用 250 个标签达到了 4.35% 的错误率,优于使用 1000 个标签训练的 Temporal Ensembling。我们还表明,良好的网络架构对性能至关重要。结合 Mean Teacher 和残差网络,我们将 CIFAR-10 上使用 4000 个标签的最先进结果从 10.55% 改进到 6.28%,将 ImageNet 2012 上使用 10% 标签的结果从 35.24% 改进到 9.11%。
引用
@article{arxiv.1703.01780,
title = {Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised deep learning results},
author = {Antti Tarvainen and Harri Valpola},
journal= {arXiv preprint arXiv:1703.01780},
year = {2018}
}
备注
In this version: Corrected hyperparameters of the 4000-label CIFAR-10 ResNet experiment. Changed Antti's contact info, Advances in Neural Information Processing Systems 30 (NIPS 2017) pre-proceedings