中文

序列中高效用情节的发现

数据库 2019-12-30 v1

摘要

序列数据(例如复杂事件序列)在真实应用中的常见程度甚于其他类型数据(例如事务数据)。对于序列数据的挖掘任务,已提出若干问题形式,如序列模式挖掘、情节挖掘与序列规则挖掘。作为基础问题之一,情节挖掘常被研究。普遍观点认为发现频繁情节不够有用。本文提出一种高效的效用挖掘方法,称为 UMEpi:从复杂事件序列中挖掘高效用情节(Utility Mining of high-utility Episodes)。我们提出情节的剩余效用概念,并得到一个更紧的上界,即情节加权利用率(EWU),其将提供更好的剪枝。因此,优化的基于 EWU 的剪枝策略可在挖掘效率上取得更好改进。UMEpi 关于基于前缀的字典序序列树的搜索空间被跨展并递归确定以挖掘高效用情节,通过深度优先方式的前缀跨展。最后,在四个真实数据集上的大量实验表明,UMEpi 能从复杂事件序列中发现完整的高效用情节,而最先进算法未能返回正确结果。此外,UMEpi 的改进变体在执行时间、内存消耗与可扩展性方面显著优于基线。

关键词

引用

@article{arxiv.1912.11670,
  title  = {Discovering High Utility Episodes in Sequences},
  author = {Wensheng Gan and Jerry Chun-Wei Lin and Han-Chieh Chao and Philip S. Yu},
  journal= {arXiv preprint arXiv:1912.11670},
  year   = {2019}
}

备注

IEEE Transactions on Big Data, under review, 13 pages, 5 figures