通过置信度评估改进自训练的训练过程
机器学习
2018-04-06 v2
摘要
众所周知,对于某些任务,标注数据集可能难以收集。因此,我们希望在此解决训练数据不足的问题。我们研究了在有限的标注数据集上进行初始训练后,从无标注数据中学习的方法。所提出的方法可用作在无标注测试集上的在线学习方法。在一般分类任务中,每当我们以足够高的置信度预测一个标签时,就将其视为真实标签并据此训练数据。对于语义分割任务(数据标注过程昂贵的一个典型例子),我们逐像素地进行此操作。我们将所提出的方法应用于 MNIST 数据集作为视觉分类任务的概念验证,并应用于 ADE20K 数据集以解决半监督语义分割问题。
引用
@article{arxiv.1710.00209,
title = {Improved Training for Self-Training by Confidence Assessments},
author = {Gal Hyams and Daniel Greenfeld and Dor Bank},
journal= {arXiv preprint arXiv:1710.00209},
year = {2018}
}