中文

下限能有多低?面向无监督异常检测的典型分布内样本挖掘

计算机视觉与模式识别 2024-10-29 v2

摘要

无监督异常检测通过仅在未标记的分布内数据上训练并将离群点检测为异常,从而减轻了大量标注工作。通常认为,大型训练数据集能够训练出性能更高的无监督异常检测模型。然而,在本工作中,我们表明使用极少训练样本的无监督异常检测已经能够匹敌,甚至在某些情况下超越使用整个训练集进行训练的性能。基于这一发现,我们提出了一种无监督方法来可靠地识别典型样本,以进一步提升无监督异常检测的性能。我们在计算机视觉、工业缺陷检测和医学领域的七个不同已确立的无监督异常检测基准上验证了该方法的实用性。仅使用 25 个选定样本,我们甚至在这些基准的 25/6725/67 个类别中超越了全量训练的性能。此外,我们表明我们提出的方法所识别的典型分布内样本在不同模型和数据集间具有良好的泛化能力,并且观察其样本选择标准可以成功地手动选择出高性能样本的小子集。我们的代码可在 https://anonymous.4open.science/r/uad_prototypical_samples/ 获取。

关键词

引用

@article{arxiv.2312.03804,
  title  = {How Low Can You Go? Surfacing Prototypical In-Distribution Samples for Unsupervised Anomaly Detection},
  author = {Felix Meissen and Johannes Getzner and Alexander Ziller and Özgün Turgut and Georgios Kaissis and Martin J. Menten and Daniel Rueckert},
  journal= {arXiv preprint arXiv:2312.03804},
  year   = {2024}
}