未标记数据存在多种一致解释:为何应当取平均
机器学习
2019-02-22 v3 人工智能
计算机视觉与模式识别
机器学习
摘要
目前最成功的半监督学习方法基于一致性正则化,即训练模型对其输入和参数的微小扰动具有鲁棒性。为理解一致性正则化,我们从概念上探究损失几何如何与训练过程相互作用。一致性损失相比仅监督训练显著提升了泛化性能;然而,我们表明SGD难以在一致性损失上收敛,并持续产生较大步长,导致测试数据上预测发生变化。受这些观察启发,我们提出使用随机权重平均(SWA)训练基于一致性的方法,SWA是一种近期通过修正学习率调度在SGD轨迹上平均权重的方法。我们还提出fast-SWA,其通过在循环学习率调度的每个周期内平均多个点进一步加速收敛。通过权重平均,我们在CIFAR-10和CIFAR-100上以多种不同数量的标记训练数据取得了已知的最佳半监督结果。例如,仅用4000个标签我们在CIFAR-10上达到5.0%错误率,而文献中先前最佳结果为6.3%。
引用
@article{arxiv.1806.05594,
title = {There Are Many Consistent Explanations of Unlabeled Data: Why You Should Average},
author = {Ben Athiwaratkun and Marc Finzi and Pavel Izmailov and Andrew Gordon Wilson},
journal= {arXiv preprint arXiv:1806.05594},
year = {2019}
}
备注
Appears at ICLR 2019