中文

流式相似度自连接

数据库 2016-03-09 v2 数据结构与算法

摘要

我们介绍并研究了在流式上下文中计算相似度自连接的问题(SSSJ),其中输入是持续到达的项目的无界流。目标是找到流中相似度大于给定阈值的所有项目对。该问题的最简单表述需要无界内存,因此是难以处理的。为使问题可行,我们引入了时间相关相似度的概念:两个项目的相似度随其到达时间差的增大而减小。通过利用此时间相关相似度函数的性质,我们设计了两个算法框架来解决 SSSJ 问题。第一个框架 MiniBatch (MB) 使用针对该问题静态版本的现有基于索引的过滤技术,并将它们组合在一个流水线中。第二个框架 Streaming (STR) 在现有索引中添加时间过滤,并将新的基于时间的界限深度集成到算法的工作中。我们还引入了一种新的索引技术 (L2),它基于现有的最先进索引技术 (L2AP),但针对流式情况进行了优化。大量实验表明,使用 L2 索引实例化的 STR 算法在广泛的数据集和参数中是最具可扩展性的选择。

关键词

引用

@article{arxiv.1601.04814,
  title  = {Streaming Similarity Self-Join},
  author = {Gianmarco De Francisci Morales and Aristides Gionis},
  journal= {arXiv preprint arXiv:1601.04814},
  year   = {2016}
}