中文

非独立同分布类别数据中的同质性异常检测

机器学习 2021-03-23 v1 人工智能 机器学习

摘要

大多数现有异常检测方法假设数据实体(如特征值和数据对象)的异常因子(即异常性评分度量)是独立同分布 (IID) 的。该假设在现实应用中不成立,因为不同实体的异常性相互依赖和/或取自不同概率分布(非 IID)。这可能导致无法检测到重要的异常,这些异常若不考虑非 IID 特性则过于细微而难以识别。在更具挑战性的情境下该问题更为严重,例如具有许多噪声特征的高维数据。本工作引入了一种新颖的异常检测框架及其两个实例,通过捕捉非 IID 异常因子来识别类别数据中的异常。我们的方法首先定义对分布敏感的异常因子及其相互依赖关系,并将其纳入基于值-值图的表示中。然后在值图上建模异常性传播过程以学习特征值的异常性。学到的价值异常性可用于直接异常检测或离群特征选择。此处采用图表示与挖掘方法以充分捕捉丰富的非 IID 特征。我们在 15 个具有不同数据复杂度的真实数据集上的实证结果表明:(i) 所提异常检测方法在 95%/99% 置信水平下显著优于五种最先进方法,在 10 个最复杂数据集上实现 10%–28% 的 AUC 提升;(ii) 所提特征选择方法在赋能后续两种不同现有检测器的异常检测方面显著优于三种竞争方法。

关键词

引用

@article{arxiv.2103.11516,
  title  = {Homophily Outlier Detection in Non-IID Categorical Data},
  author = {Guansong Pang and Longbing Cao and Ling Chen},
  journal= {arXiv preprint arXiv:2103.11516},
  year   = {2021}
}

备注

To appear in Data Ming and Knowledge Discovery Journal