自监督、精炼、重复:改进无监督异常检测
机器学习
2022-08-08 v2
摘要
异常检测(AD),即将异常与正常数据分离,在从安全到医疗的诸多领域都有应用。虽然大多数先前工作被证明在完全或部分标注数据的情形下有效,但由于该任务的标注尤为繁琐,这种设置在实践中较少见。本文关注完全无监督的 AD,其中整个训练数据集(包含正常和异常样本)均无标注。为有效解决此问题,我们提出利用数据精炼过程来提高在自监督表示上训练的一类分类器的鲁棒性。我们提出的数据精炼方法基于一类分类器(OCCs)的集成,每个分类器在训练数据的互不相交子集上训练。在精炼数据上通过自监督学习学到的表示随数据精炼的改善而迭代更新。我们在图像和表格数据的各种无监督 AD 任务上展示了我们的方法。在 CIFAR-10 图像数据异常比例 10% / Thyroid 表格数据异常比例 2.5% 下,所提方法优于最先进的一类分类器,AUC 提升 6.3、平均精度提升 12.5 / F1 分数提升 22.9。
引用
@article{arxiv.2106.06115,
title = {Self-supervise, Refine, Repeat: Improving Unsupervised Anomaly Detection},
author = {Jinsung Yoon and Kihyuk Sohn and Chun-Liang Li and Sercan O. Arik and Chen-Yu Lee and Tomas Pfister},
journal= {arXiv preprint arXiv:2106.06115},
year = {2022}
}
备注
Published in Transactions on Machine Learning Research (TMLR) - August, 2022 - https://openreview.net/forum?id=b3v1UrtF6G