基于Mondrian Pólya森林的数据流可解释异常检测
机器学习
2020-08-05 v1 机器学习
摘要
大规模异常检测是一个极具挑战性且非常实用的问题。当数据量大且高维时,难以检测哪些观测不符合预期行为。近期工作集中于使用(随机)d-树变体来汇总数据以进行异常检测。然而,这些方法依赖不易解释的临时评分函数,使得在缺乏标注异常时难以评估检测异常的严重程度或选择合理阈值。为解决这些问题,我们将这些方法置于一个概率框架中,称之为Mondrian Pólya森林,用于估计生成数据的底层概率密度函数,并提供比先前工作更强的可解释性。此外,我们开发了一种内存高效变体,能够在现代流式环境中运行。我们的实验表明,这些方法在提供统计可解释异常分数的同时达到了最先进的性能。
引用
@article{arxiv.2008.01505,
title = {Interpretable Anomaly Detection with Mondrian P{\'o}lya Forests on Data Streams},
author = {Charlie Dickens and Eric Meissner and Pablo G. Moreno and Tom Diethe},
journal= {arXiv preprint arXiv:2008.01505},
year = {2020}
}