中文

基于双向不确定性的开放集标注主动学习

机器学习 2024-11-14 v2

摘要

开放集场景下的主动学习(AL)面临一个新挑战:如何从未标注数据池中识别出最有价值的样本,该数据池包含来自已知类和未知类的数据。传统方法优先选择低置信度但信息量大的样本,但存在误选同样低置信度的未知类样本的风险。近期方法则倾向于选择最可能的已知类样本,但可能选到已掌握的简单样本。本文尝试查询既可能来自已知类又信息量大的样本,并提出了一种基于双向不确定性的主动学习(BUAL)框架。具体而言,我们首先通过提出的随机标签负学习方法将未知类样本推向高置信度预测区域。然后,我们提出了一种双向不确定性采样策略,通过联合估计正学习和负学习带来的不确定性来进行一致且稳定的采样。BUAL成功地将现有的基于不确定性的主动学习方法扩展到复杂的开放集场景。在多个不同开放度数据集上的大量实验表明,BUAL达到了最先进的性能。代码可在https://github.com/chenchenzong/BUAL获取。

关键词

引用

@article{arxiv.2402.15198,
  title  = {Bidirectional Uncertainty-Based Active Learning for Open Set Annotation},
  author = {Chen-Chen Zong and Ye-Wen Wang and Kun-Peng Ning and Hai-Bo Ye and Sheng-Jun Huang},
  journal= {arXiv preprint arXiv:2402.15198},
  year   = {2024}
}

备注

Accepted to ECCV 2024