异常检测中最近邻方法的统计分析
机器学习
2019-07-10 v1 机器学习
统计理论
统计理论
摘要
最近邻(NN)过程在监督和无监督学习问题中均被充分研究并广泛使用。本文关注研究基于NN的方法在异常检测中的表现。我们首先通过大量仿真表明,基于一组基准合成数据集,NN方法与一些其他最先进的异常检测算法相比具有优势。我们进一步考虑NN方法在真实数据集上的表现,并将其与问题的维度相关联。接下来,我们通过研究称为距离度量(DTM)的更一般量来分析NN异常检测方法的理论性质,DTM最初发展于鲁棒几何与拓扑推断的文献中。我们给出经验DTM的有限样本一致保证,并用其推导各种设定下异常观测的误分类率。在我们的分析中,依赖于Huber污染模型,并对数据底层分布提出温和的几何正则性假设。
引用
@article{arxiv.1907.03813,
title = {Statistical Analysis of Nearest Neighbor Methods for Anomaly Detection},
author = {Xiaoyi Gu and Leman Akoglu and Alessandro Rinaldo},
journal= {arXiv preprint arXiv:1907.03813},
year = {2019}
}