中文

如何分配标注预算?异常检测中主动学习与拒绝学习的取舍

机器学习 2023-01-10 v1

摘要

异常检测旨在发现偏离预期行为的样本。通常,由于异常标签稀少且难以获取,异常检测从无监督视角着手。然而,标签的缺失使异常检测器在某些区域具有高度不确定性,通常导致预测性能不佳或用户对预测缺乏信任。人们可通过主动学习(AL)收集特定标签来降低此类不确定性,AL针对靠近检测器决策边界的样本。或者,可通过允许检测器对高度不确定的预测弃判来提升用户信任,称为拒绝学习(LR)。一种实现方式是基于检测器性能较低之处对其不确定性设阈,而这需要标签进行评估。尽管AL与LR均需标签,但它们所用标签类型不同:AL寻求策略性标签,其明显有偏;而LR需要独立同分布(i.i.d.)标签以评估检测器性能并设定拒绝阈值。由于通常只有唯一标注预算,如何最优分配颇具挑战。本文提出一种混合策略,在给定标签预算下,多轮决策将该预算用于收集AL标签还是LR标签。该策略基于一个奖励函数,衡量将预算分配给任一方时的期望增益。我们在18个基准数据集上评估该策略,并与若干基线比较。

关键词

引用

@article{arxiv.2301.02909,
  title  = {How to Allocate your Label Budget? Choosing between Active Learning and Learning to Reject in Anomaly Detection},
  author = {Lorenzo Perini and Daniele Giannuzzi and Jesse Davis},
  journal= {arXiv preprint arXiv:2301.02909},
  year   = {2023}
}

备注

Paper presented at the 1st AAAI Workshop on Uncertainty Reasoning and Quantification in Decision Making