中文

用于异常检测的正常数据子簇

机器学习 2020-11-18 v1 计算机视觉与模式识别

摘要

数据分析中的异常检测是一个有趣但在现实世界应用中仍具挑战性的研究课题。随着数据维度的复杂性增加,需要理解其描述中的语义上下文以实现有效的异常刻画。然而,现有异常检测方法在高维数据(如 ImageNet)上表现有限。现有研究多在低维、干净且分离良好的数据集(如 MNIST 和 CIFAR-10)上评估性能。在本文中,我们研究高维复杂正常数据的异常检测。我们的观察是,一般而言,异常数据由语义可解释的特征定义,这些特征同样可用于定义正常数据的语义子簇。我们假设,若存在合理良好的特征空间对给定正常数据的子簇进行语义分离,则未见异常也能在该空间中与正常数据良好区分。我们提出对给定正常数据进行语义聚类,并训练分类器以学习判别性特征空间,最终在该空间执行异常检测。基于我们在 MNIST、CIFAR-10 和 ImageNet 上以正常与异常数据的多种组合进行的细致广泛实验评估,表明我们的异常检测方案优于 SOTA 方法,尤其在高维真实世界图像上。

关键词

引用

@article{arxiv.2011.08408,
  title  = {Sub-clusters of Normal Data for Anomaly Detection},
  author = {Gahye Lee and Seungkyu Lee},
  journal= {arXiv preprint arXiv:2011.08408},
  year   = {2020}
}