中文

高密度异常检测算法框架

机器学习 2021-04-06 v2 数据库 机器学习

摘要

本研究探讨高密度异常的概念。与传统将异常视为孤立出现的观点相反,高密度异常是位于数据空间中最正常区域中的偏离样本。此类异常与多种实际用例相关,例如不当行为检测与数据质量分析。在分析非常大或含噪的数据集时,传统异常检测算法会返回许多假阳性,因此识别它们的有效方法尤为重要。为能够识别高密度异常,本研究引入了若干用于无监督检测的非参数算法框架。这些框架能够利用已有的底层异常检测算法,并为该检测任务中固有的平衡问题提供不同解决方案。我们使用合成与真实世界数据集对框架进行评估,并与已有的传统异常检测基线算法比较。迭代部分推动(IPP)框架被证明能产生最佳检测结果。

关键词

引用

@article{arxiv.2010.04705,
  title  = {Algorithmic Frameworks for the Detection of High Density Anomalies},
  author = {Ralph Foorthuis},
  journal= {arXiv preprint arXiv:2010.04705},
  year   = {2021}
}

备注

10 pages, 9 figures, 6 tables. Accepted for presentation at IEEE SSCI CIDM 2020 (Symposium on Computational Intelligence in Data Mining)