中文

基于置信度估计通过伪标签选择性训练的半监督学习

机器学习 2021-03-16 v1

摘要

我们提出一种采用伪标签选择性训练的半监督学习(SSL)新方法。在我们的方法中,我们生成硬伪标签并估计其置信度,该置信度表示每个伪标签正确的可能性。然后,我们显式选择哪些伪标签数据应用于更新模型。具体而言,假设在错误伪标签数据上的损失相对于数据增强会敏感增大,我们选择应用数据增强后损失相对较小的数据。置信度不仅用于筛选待选的伪标签数据,还用于自动决定在一个小批量中选择多少伪标签数据。由于准确估计置信度在我们的方法中至关重要,我们还提出一种称为MixConf的新数据增强方法,即使训练数据数量较少也能使我们获得置信度校准的模型。使用多个基准数据集的实验结果验证了我们的SSL方法以及MixConf的优势。

关键词

引用

@article{arxiv.2103.08193,
  title  = {Semi-supervised learning by selective training with pseudo labels via confidence estimation},
  author = {Masato Ishii},
  journal= {arXiv preprint arXiv:2103.08193},
  year   = {2021}
}