论在事务流中寻找相似项
数据结构与算法
2010-10-13 v1 数据库
摘要
尽管在事务数据流中寻找频繁项集方面已有大量工作,但其中没有一项工作能解决根据标准相似性度量寻找相似对的问题。本文是处理这个可以说更重要问题的首次尝试。我们从一个负面结果开始,该结果也解释了缺乏用于寻找频繁项集的数据挖掘算法空间使用理论上界的原因:任何(即使是近似且允许出错概率的)寻找最频繁k-项集的算法,都必须使用Ω(min{mb, n^k, (mb/φ)^k})比特的空间,其中mb是迄今为止流中的项数,n是不同项的数目,φ是支持度阈值。因此,要获得任何非平凡的空间上界,我们必须放弃对数据流的最坏情况假设。我们在事务以随机顺序到达的模型下工作,并令人惊讶地表明,不仅对于最常见的相似性度量,小空间相似性挖掘是可能的,而且对于任何固定的支持度阈值,挖掘精度会随着流的长度增加而提高。
引用
@article{arxiv.1010.2371,
title = {On Finding Similar Items in a Stream of Transactions},
author = {Andrea Campagna and Rasmus Pagh},
journal= {arXiv preprint arXiv:1010.2371},
year = {2010}
}
备注
Appears in proceedings of the IEEE International Workshop on Knowledge Discovery Using Cloud and Distributed Computing Platforms (KDCloud, 2010); publisher: IEEE