SWOOP:基于集合流的 Top-k 相似连接
数据库
2019-12-04 v2
摘要
我们为旨在持续发现快速集合流中相似集合对的应用提供高效支持。一个典型的示例场景是推文。一条推文是一个词集合,而 Twitter 每天发出约五亿条推文。我们的解决方案使得高效维护来自一对快速 Twitter 流的 top- 最相似推文成为可能,例如,若流涉及城市,则可发现两城市中的相似趋势。采用滑动窗口模型,随着流中新集合进入窗口或已有集合离开窗口,top- 结果会发生变化。在快速流下维护 top- 结果具有挑战性。首先,当集合到达时,它可能与窗口中已有任意集合构成 top- 结果的新配对。其次,当集合离开窗口时,其在 top- 中的所有配对均失效且必须被替换。仅维护 个最相似配对是不够的,因为较不相似的配对最终可能被提升为 top- 结果。一种将每个新集合与窗口中所有集合配对并为维护 top- 结果保留所有配对的直白方案内存消耗大且过于缓慢。我们提出 SWOOP,一种解决这些问题的高度可扩展流连接算法。新颖的索引技术与精细过滤器在新集合进入窗口时高效剪除无用配对。SWOOP 增量维护一个相似配对库,以随时更新 top- 结果,且该配对库被证明是最小的。我们的实验证实,SWOOP 能够处理的流速率比现有方法的速率快数个数量级。
引用
@article{arxiv.1711.02476,
title = {SWOOP: Top-k Similarity Joins over Set Streams},
author = {Willi Mann and Nikolaus Augsten and Christian S. Jensen},
journal= {arXiv preprint arXiv:1711.02476},
year = {2019}
}