中文

Sinkhorn 标签分配:基于退火自训练的半监督分类

机器学习 2021-06-15 v2 机器学习

摘要

自训练是一种标准的半监督学习方法,其中学习器对无标签数据的自身预测在训练期间被用作监督信号。在本文中,我们将这一标签分配过程重新解释为样本与类别之间的最优传输问题,其中将样本分配给某个类别的代价由分类器当前的预测所调节。该表述促进了一种实用的标签分配退火策略,并允许通过灵活的上界约束引入关于类别比例的先验知识。这些分配问题的解可以使用 Sinkhorn 迭代高效近似,从而使其能够在标准随机优化算法的内循环中使用。我们在 CIFAR-10、CIFAR-100 和 SVHN 数据集上展示了我们算法的有效性,并与最先进的自训练算法 FixMatch 进行了比较。我们的代码可在 https://github.com/stanford-futuredata/sinkhorn-label-allocation 获取。

关键词

引用

@article{arxiv.2102.08622,
  title  = {Sinkhorn Label Allocation: Semi-Supervised Classification via Annealed Self-Training},
  author = {Kai Sheng Tai and Peter Bailis and Gregory Valiant},
  journal= {arXiv preprint arXiv:2102.08622},
  year   = {2021}
}

备注

ICML 2021 camera ready version