中文

基于时间输出差异的半监督主动学习

计算机视觉与模式识别 2021-07-30 v1 机器学习

摘要

尽管深度学习在广泛任务中取得成功,但它高度依赖于海量标注数据的收集,而这昂贵且耗时。为降低数据标注成本,主动学习被提出以交互式查询 oracle 来标注未标注数据集中一小部分信息量大的样本。受损失较高的样本通常比损失较低的样本对模型更具信息性这一事实的启发,本文提出一种新颖的深度主动学习方法,当未标注样本被认为包含高损失时查询 oracle 进行数据标注。我们方法的核心是一种称为时间输出差异(TOD)的度量,它通过评估不同优化步骤下模型输出之间的差异来估计样本损失。我们的理论研究表明 TOD 是累积样本损失的下界,因此可用于选择信息性未标注样本。基于 TOD,我们进一步开发了有效的未标注数据采样策略以及通过引入未标注数据来增强模型性能的无监督学习准则。由于 TOD 的简单性,我们的主动学习方法高效、灵活且任务无关。大量实验结果表明,在图像分类和语义分割任务上,我们的方法比最先进的主动学习方法取得了更优的性能。

关键词

引用

@article{arxiv.2107.14153,
  title  = {Semi-Supervised Active Learning with Temporal Output Discrepancy},
  author = {Siyu Huang and Tianyang Wang and Haoyi Xiong and Jun Huan and Dejing Dou},
  journal= {arXiv preprint arXiv:2107.14153},
  year   = {2021}
}

备注

ICCV 2021. Code is available at https://github.com/siyuhuang/TOD