中文

通过置信度评估改进自训练的训练过程

机器学习 2018-04-06 v2

摘要

众所周知,对于某些任务,标注数据集可能难以收集。因此,我们希望在此解决训练数据不足的问题。我们研究了在有限的标注数据集上进行初始训练后,从无标注数据中学习的方法。所提出的方法可用作在无标注测试集上的在线学习方法。在一般分类任务中,每当我们以足够高的置信度预测一个标签时,就将其视为真实标签并据此训练数据。对于语义分割任务(数据标注过程昂贵的一个典型例子),我们逐像素地进行此操作。我们将所提出的方法应用于 MNIST 数据集作为视觉分类任务的概念验证,并应用于 ADE20K 数据集以解决半监督语义分割问题。

关键词

引用

@article{arxiv.1710.00209,
  title  = {Improved Training for Self-Training by Confidence Assessments},
  author = {Gal Hyams and Daniel Greenfeld and Dor Bank},
  journal= {arXiv preprint arXiv:1710.00209},
  year   = {2018}
}