中文

大规模流数据中的相关异常检测

机器学习 2019-01-18 v2 机器学习

摘要

流数据中的相关异常检测(CAD)是一种群体异常检测,也是僵尸网络检测、金融事件检测、工业过程监控等实用实时数据挖掘应用中的关键任务。以往研究中此类检测的主要方法基于划分批次或滑动窗口的主分数(PS),通过计算相关矩阵的顶级特征值(如 Lanczos 算法)实现。然而,本文提出了大规模数据集上主分数退化的现象,并从数学与实际两方面证明,即便相关异常数量以合理速率随数据规模增长,当前基于 PS 的方法也很可能在大尺度流数据的 CAD 上失效;现实中异常往往占数据少数,该问题可能更为严重。我们提出一个包含两种新颖随机化算法 rPS 与 gPS 的框架,以更好地从具有不同相关强度的大规模流数据中检测相关异常。实验表明,相较于直接主分数评估和若干近期群体异常检测算法,我们的框架在大规模服务器日志数据集与美国股票每日价格数据集上的异常检测具有较高且均衡的召回率与估计准确率。此外,我们的技术显著提升了主分数计算的计算效率与可扩展性。

关键词

引用

@article{arxiv.1812.09387,
  title  = {Correlated Anomaly Detection from Large Streaming Data},
  author = {Zheng Chen and Xinli Yu and Yuan Ling and Bo Song and Wei Quan and Xiaohua Hu and Erjia Yan},
  journal= {arXiv preprint arXiv:1812.09387},
  year   = {2019}
}