中文

基于 copula 的大规模高维连续数据异常评分与定位

机器学习 2019-12-05 v1 计算工程、金融与科学 概率论 机器学习

摘要

本文提出的异常检测方法具有一个特点:它不仅指示观测是否异常,还指明导致异常观测不寻常的具体原因。因此,它支持对异常原因进行定位。所提方法基于模型,依赖于与观测相关的多元概率分布。由于稀有事件存在于概率分布的尾部,我们使用能够良好建模厚尾分布的 copula 函数。所述过程具有良好的可扩展性,可处理大量高维样本。此外,我们的过程也能应对高维数据集中频繁出现的缺失值。在论文第二部分,我们通过案例研究展示该方法的实用性,分析了由真实移动电信网络的性能计数器组成的大型数据集。由于此类网络是复杂系统,次优运行的迹象可能在较长时间内隐藏。利用所提过程,许多此类隐藏问题可被隔离并指示给网络运营商。

关键词

引用

@article{arxiv.1912.02166,
  title  = {Copula-based anomaly scoring and localization for large-scale, high-dimensional continuous data},
  author = {Gábor Horváth and Edith Kovács and Roland Molontay and Szabolcs Nováczki},
  journal= {arXiv preprint arXiv:1912.02166},
  year   = {2019}
}

备注

27 pages, 12 figures, accepted at ACM Transactions on Intelligent Systems and Technology