序列数据的在架效用挖掘
数据库
2020-11-30 v1
摘要
效用挖掘因其广泛应用和相当 popularity 已成为一个重要且有趣的话题。然而,传统效用挖掘方法偏向于具有更长在架时间的项,因为它们有更大机会产生高效用。为消除该偏差,引入了在架效用挖掘(OSUM)问题。本文中,我们聚焦于序列数据的 OSUM 任务,其中序列数据库根据时间段划分为若干分区,且项关联有效用和若干在架时间段。为解决该问题,我们提出两种方法,序列数据在架效用挖掘(OSUMS)和 OSUMS+,以提取在架高效用序列模式。为进一步提升效率,我们还设计了若干策略以缩减搜索空间并避免冗余计算,采用两个上界时间前缀扩展效用(TPEU)和时间约简序列效用(TRSU)。此外,开发了两种新颖数据结构以促进上界和效用的计算。在特定真实与合成数据集上的大量实验结果表明,这两种方法优于最先进算法。总之,OSUMS 可能消耗大量内存且不适用于内存受限情形,而 OSUMS+ 因其高效性具有更广泛的现实应用。
引用
@article{arxiv.2011.13455,
title = {On-shelf Utility Mining of Sequence Data},
author = {Chunkai Zhang and Zilin Du and Yuting Yang and Wensheng Gan and Philip S. Yu},
journal= {arXiv preprint arXiv:2011.13455},
year = {2020}
}
备注
Preprint under review, 11 figures