少即是多:构建选择性异常集成方法
数据库
2015-01-12 v1 机器学习
摘要
用于分类与聚类的集成技术早已被证明有效,然而异常集成却鲜有研究。本文针对这一空白提出一种新的异常挖掘集成方法,并应用于时序图中的事件检测。我们的方法旨在合并具有不同输出的异构检测器的结果,并利用多源证据以获得更优性能。然而,信任所有结果可能会降低整体集成精度,因为某些检测器可能受限于手中数据的性质而表现不佳并给出不准确结果。这表明在组合哪些结果时保持选择性对于构建有效集成至关重要——即“少即是多”。本文提出 SELECT;一种异常挖掘集成方法,采用新技术以完全无监督的方式自动且系统地选择待组装的结果。我们将该方法应用于时序图中的事件检测,其中 SELECT 在统一集成框架下成功利用了五个基础检测器和七种共识方法。我们在五个真实世界数据集(四个带真值)上对所提方法进行了广泛的定量评估,包括 Enron 电子邮件通信、New York Times 新闻语料库和 World Cup 2014 Twitter 新闻流。得益于其选择机制,SELECT 相较于单一检测器、完整集成(朴素合并所有结果)以及一种现有的基于多样性的集成均取得了更优性能。
引用
@article{arxiv.1501.01924,
title = {Less is More: Building Selective Anomaly Ensembles},
author = {Shebuti Rayana and Leman Akoglu},
journal= {arXiv preprint arXiv:1501.01924},
year = {2015}
}
备注
14 pages, 5 pages Appendix, 10 Figures, 15 Tables, to appear at SDM 2015