中文

大数据中的异常检测

机器学习 2022-03-04 v1

摘要

异常被定义为不符合正常行为的系统状态。例如,核反应堆通道中中子发射超过规定阈值即为异常。大数据指的是具有\emph{高容量、流式、异构、分布式}且通常\emph{稀疏}的数据集。如今大数据已不罕见。例如,据Internet live stats,每日发布的推文数量已超过5亿。由于数据负载领域的数据爆炸,为小数据集开发的传统异常检测技术在大规模数据集上扩展性差。因此,我们采用替代方法来处理大数据中的异常检测。本质上,扩展大数据异常检测有两种方式。第一种基于\emph{在线}学习,第二种基于\emph{分布式}学习。我们在论文中的目标是高效检测异常的同时解决大数据问题。为此,我们首先处理大数据的\emph{流式}问题,并提出Passive-Aggressive GMEAN (PAGMEAN)算法。尽管在线学习算法能在大量数据点和维度上良好扩展,但当数据分布式存于多处时(如今十分常见)它们无法处理。因此,我们提出一种基于ADMM的天然分布式异常检测算法。最后,我们给出核电厂数据异常检测的案例研究。

关键词

引用

@article{arxiv.2203.01684,
  title  = {Anomaly Detection in Big Data},
  author = {Chandresh Kumar Maurya},
  journal= {arXiv preprint arXiv:2203.01684},
  year   = {2022}
}

备注

148 pages. PhD Thesis. Work done in collaboration with Durga Toshnwial, IIT Roorkee, and Dr. Vijendra, Robert Bosch