基于一致性的半监督主动学习:迈向最小化标注成本
机器学习
2020-07-21 v2 计算机视觉与模式识别
摘要
主动学习(AL)结合了数据标注和模型训练,通过优先选择最能改善模型性能的高价值数据来最小化标注成本。在基于池的主动学习中,大多数传统方法并未将可访问的未标注数据用于模型训练。在此,我们提出统一未标注样本选择和模型训练,以最小化标注成本,并为此做出两点贡献。首先,我们利用半监督学习(SSL)同时利用已标注和未标注数据,在训练阶段从未标注数据中提取信息。其次,我们提出一种与训练目标一致的、基于一致性的样本选择度量,使得所选样本能有效提升模型性能。我们在图像分类任务上进行了大量实验。在CIFAR-10、CIFAR-100和ImageNet上的实验结果表明,与现有方法以及其他AL和SSL组合相比,我们提出的方法在标注数据有限的情况下具有优越的性能。此外,我们研究了一个重要但尚未充分探索的问题——“我们何时可以开始基于学习的AL选择?”。我们提出了一种与AL目标损失经验相关的度量,该度量可能有助于确定基于学习的AL方法的合适起点。
引用
@article{arxiv.1910.07153,
title = {Consistency-based Semi-supervised Active Learning: Towards Minimizing Labeling Cost},
author = {Mingfei Gao and Zizhao Zhang and Guo Yu and Sercan O. Arik and Larry S. Davis and Tomas Pfister},
journal= {arXiv preprint arXiv:1910.07153},
year = {2020}
}
备注
Accepted by ECCV2020