流式环境下的相似连接与相似自连接规模估计
数据库
2020-05-11 v3
摘要
我们研究流式设定下的相似自连接与相似连接规模估计问题,其目标是在对输入的一次扫描中、以输入规模的亚线性空间,估计相似度在给定阈值内的记录对数量。该问题在数据清洗与查询计划生成中有诸多应用,可在实际执行连接前估计相似连接代价。对于一元输入(两条记录要么匹配要么不匹配),该问题退化为连接与自连接规模估计,对此已有现成的一次扫描算法。我们的工作针对 d 元输入(d >= 1)解决该问题,其中相似度可从 1 到 d 变化。我们证明所提算法给出准确估计且随输入规模良好扩展。我们给出误差界及时间空间开销,并对算法进行广泛实验评估,将其估计精度与若干竞争者(包括一些多遍算法)比较。结果表明,在给定相同空间下,所提算法在很大相似度阈值范围内误差小一个数量级。
引用
@article{arxiv.1806.03313,
title = {Similarity Join and Similarity Self-Join Size Estimation in a Streaming Environment},
author = {Davood Rafiei and Fan Deng},
journal= {arXiv preprint arXiv:1806.03313},
year = {2020}
}
备注
IEEE Transactions on Knowledge and Data Engineering (to appear)