中文

异常检测中最近邻方法的统计分析

机器学习 2019-07-10 v1 机器学习 统计理论 统计理论

摘要

最近邻(NN)过程在监督和无监督学习问题中均被充分研究并广泛使用。本文关注研究基于NN的方法在异常检测中的表现。我们首先通过大量仿真表明,基于一组基准合成数据集,NN方法与一些其他最先进的异常检测算法相比具有优势。我们进一步考虑NN方法在真实数据集上的表现,并将其与问题的维度相关联。接下来,我们通过研究称为距离度量(DTM)的更一般量来分析NN异常检测方法的理论性质,DTM最初发展于鲁棒几何与拓扑推断的文献中。我们给出经验DTM的有限样本一致保证,并用其推导各种设定下异常观测的误分类率。在我们的分析中,依赖于Huber污染模型,并对数据底层分布提出温和的几何正则性假设。

关键词

引用

@article{arxiv.1907.03813,
  title  = {Statistical Analysis of Nearest Neighbor Methods for Anomaly Detection},
  author = {Xiaoyi Gu and Leman Akoglu and Alessandro Rinaldo},
  journal= {arXiv preprint arXiv:1907.03813},
  year   = {2019}
}