中文

用于基于损失估计的主动学习的时序输出差异

计算机视觉与模式识别 2022-12-22 v1 机器学习

摘要

尽管深度学习在广泛的任务中取得了成功,但它高度依赖于大量标注数据的收集,这既昂贵又耗时。为了降低数据标注成本,主动学习被提出用于交互式地请求预言机标注未标注数据集中一小部分信息量大的样本。受损失较高的样本通常比损失较低的样本对模型更具信息量这一事实的启发,本文提出了一种新颖的深度主动学习方法,当认为未标注样本会带来高损失时,请求预言机对其进行标注。我们方法的核心是一个称为时序输出差异 (Temporal Output Discrepancy, TOD) 的度量,它通过评估模型在不同优化步骤给出的输出差异来估计样本损失。我们的理论研究表明,TOD 为累积样本损失提供了下界,因此可用于选择信息量大的未标注样本。在 TOD 的基础上,我们进一步开发了一种有效的未标注数据采样策略以及用于主动学习的无监督学习准则。由于 TOD 的简单性,我们的方法高效、灵活且与任务无关。大量实验结果表明,我们的方法在图像分类和语义分割任务上取得了优于 SOTA 主动学习方法的性能。此外,我们表明 TOD 可用于从候选模型池中选出可能具有最高测试精度的最佳模型。

关键词

引用

@article{arxiv.2212.10613,
  title  = {Temporal Output Discrepancy for Loss Estimation-based Active Learning},
  author = {Siyu Huang and Tianyang Wang and Haoyi Xiong and Bihan Wen and Jun Huan and Dejing Dou},
  journal= {arXiv preprint arXiv:2212.10613},
  year   = {2022}
}

备注

Accepted for IEEE Transactions on Neural Networks and Learning Systems, 2022. Journal extension of ICCV 2021 [arXiv:2107.14153]