中文

未标记数据存在多种一致解释:为何应当取平均

机器学习 2019-02-22 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

目前最成功的半监督学习方法基于一致性正则化,即训练模型对其输入和参数的微小扰动具有鲁棒性。为理解一致性正则化,我们从概念上探究损失几何如何与训练过程相互作用。一致性损失相比仅监督训练显著提升了泛化性能;然而,我们表明SGD难以在一致性损失上收敛,并持续产生较大步长,导致测试数据上预测发生变化。受这些观察启发,我们提出使用随机权重平均(SWA)训练基于一致性的方法,SWA是一种近期通过修正学习率调度在SGD轨迹上平均权重的方法。我们还提出fast-SWA,其通过在循环学习率调度的每个周期内平均多个点进一步加速收敛。通过权重平均,我们在CIFAR-10和CIFAR-100上以多种不同数量的标记训练数据取得了已知的最佳半监督结果。例如,仅用4000个标签我们在CIFAR-10上达到5.0%错误率,而文献中先前最佳结果为6.3%。

关键词

引用

@article{arxiv.1806.05594,
  title  = {There Are Many Consistent Explanations of Unlabeled Data: Why You Should Average},
  author = {Ben Athiwaratkun and Marc Finzi and Pavel Izmailov and Andrew Gordon Wilson},
  journal= {arXiv preprint arXiv:1806.05594},
  year   = {2019}
}

备注

Appears at ICLR 2019