解开辫子:在流集合中寻找离群点
数据库
2009-07-20 v1 数据结构与算法
摘要
监控大型共享计算系统(如云计算基础设施)的性能带来了许多具有挑战性的算法问题。一个常见问题是追踪在某种性能度量下偏离常态最大的用户(离群点)。从流计算的角度来看,我们可以将每个用户的性能概况视为一个数字流(例如响应时间),而共享基础设施的总体性能概况则是这些混合流的“辫子”。监控系统的目标因此是充分解开这条辫子,以追踪前 个离群点。本文研究了用于近似此类离群点的单遍算法的空间复杂度,利用多方通信复杂度证明了其下界,并提出了小内存启发式算法。一方面,对于简单的度量(如最大值或最小值),流离群点很容易追踪,但我们的理论结果排除了对大多数自然度量(如平均值、中位数或分位数)进行良好近似的可能性。另一方面,我们通过模拟表明,对于各种合成数据,我们提出的启发式算法表现相当良好。
引用
@article{arxiv.0907.2951,
title = {Untangling the Braid: Finding Outliers in a Set of Streams},
author = {Chiranjeeb Buragohain and Luca Foschini and Subhash Suri},
journal= {arXiv preprint arXiv:0907.2951},
year = {2009}
}