中文

基于语义相似度分数的无监督异常检测

机器学习 2021-03-29 v3 人工智能

摘要

将样本分类为分布内或分布外(OOD)是异常检测的一个挑战性问题,也是对分布内模型泛化能力的强力检验。本文中,我们提出了一个简单而通用的框架 {\it SemSAD},利用语义相似度分数进行异常检测。其思路是:首先为任意测试样本在训练集中找到语义上最接近的样本,其中样本间的语义关系由特征向量间的余弦相似度量化,这些特征向量在变换下保持语义不变,如几何变换(图像)、时间平移(音频信号)和同义词替换(文本)。随后,若某测试样本与其最近邻的语义相似度显著低于分布内测试样本的相应相似度,则使用训练好的判别器将其分类为 OOD。我们能够在视觉领域的异常、新颖性或分布外检测上大幅超越以往方法。特别地,在给定 CIFAR-100 为分布内、检测 CIFAR-10 样本为分布外的挑战性任务中,我们无需使用标签信息即获得了接近 1 的 AUROC 值。

关键词

引用

@article{arxiv.2012.00461,
  title  = {Unsupervised Anomaly Detection From Semantic Similarity Scores},
  author = {Nima Rafiee and Rahil Gholamipoor and Markus Kollmann},
  journal= {arXiv preprint arXiv:2012.00461},
  year   = {2021}
}

备注

The reported AUROC values are wrong due to an implementation error. In short, there was information leakage by Batch Normalisation during training the discriminator