中文

基于稠密子张量挖掘的太字节级多方面数据组异常检测

数据库 2020-12-22 v3 分布式、并行与集群计算 社会与信息网络

摘要

我们如何能在大规模多方面数据(即张量)中检测欺诈性锁步行为?当数据大到无法放入内存甚至磁盘时,我们还能检测吗?过往研究表明,真实世界张量(如社交媒体、维基百科、TCP 转储等)中的稠密子张量预示着异常或欺诈行为,例如转推刷量、机器人活动与网络攻击。因此,人们提出了包括张量分解与搜索在内的多种方法,以快速准确地检测稠密子张量。然而,现有方法精度低,或假定张量小到可放入主存,这在社交媒体与网络等许多真实应用中不现实。为克服这些局限,我们提出 D-CUBE,一种基于磁盘的稠密子张量检测方法,其亦可在多机间分布式运行。相较于最先进(state-of-the-art)方法,D-CUBE 具有:(1) 内存高效:所需内存至多减少 1,561 倍,可处理大 1,000 倍(2.6TB)的数据;(2) 快速:因其近线性可扩展性而至多快 7 倍;(3) 可证明准确:对检测到的子张量密度提供保证;(4) 有效:最准确地从 TCP 转储中发现网络攻击及评分数据中的同步行为。

关键词

引用

@article{arxiv.1802.01065,
  title  = {Detecting Group Anomalies in Tera-Scale Multi-Aspect Data via Dense-Subtensor Mining},
  author = {Kijung Shin and Bryan Hooi and Jisu Kim and Christos Faloutsos},
  journal= {arXiv preprint arXiv:1802.01065},
  year   = {2020}
}

备注

28 pages