中文

将半监督学习目标视为数据整理生成模型中的对数似然

机器学习 2021-10-11 v2 机器学习

摘要

我们目前尚未将伪标注和熵最小化等半监督学习(SSL)目标理解为对数似然,这阻碍了例如贝叶斯 SSL 的发展。在此,我们注意到 CIFAR-10 等基准图像数据集是经过精心整理的,并将 SSL 目标表述为数据整理生成模型中的对数似然,该模型最初是为解释冷后验效应而开发的(Aitchison 2020)。从熵最小化和伪标注,到类似 FixMatch 的最先进技术,SSL 方法均可理解为我们对数似然原理性下界。因此,我们能够在玩具数据上给出贝叶斯 SSL 的概念验证。最后,我们的理论表明,SSL 之所以有效,部分原因在于数据整理所诱导的统计模式。这解释了过去的结果,即 SSL 在没有任何“分布外”样本的干净数据集上表现更好。为证实这些结果,我们使用基于 Galaxy Zoo 2 的匹配整理与未整理数据集,发现 SSL 在整理数据上比在未整理数据上带来了更大的性能提升。

关键词

引用

@article{arxiv.2008.05913,
  title  = {Semi-supervised learning objectives as log-likelihoods in a generative model of data curation},
  author = {Stoil Ganev and Laurence Aitchison},
  journal= {arXiv preprint arXiv:2008.05913},
  year   = {2021}
}