面向数据发现的连接质量度量与预测
数据库
2023-06-01 v1
摘要
我们研究大规模可连接数据集的发现问题。我们从基于轮廓的学习视角切入该问题。轮廓是捕获数据集模式与数据值底层特征的简洁表示,能够以分布式并行方式高效提取。随后通过比较轮廓,预测来自不同数据集的一对属性间连接操作的质量。与现有最优方法不同,我们定义了一种新的连接质量概念,其依赖的度量同时考虑连接候选属性间的包含度与基数比例。我们在名为 NextiaJD 的系统中实现了该方法,并通过实验展示我们方法的预测性能与计算效率。实验表明,NextiaJD 相比基于哈希的方法获得了更优的预测性能,同时能够扩展到更大数据量。
引用
@article{arxiv.2305.19629,
title = {Measuring and Predicting the Quality of a Join for Data Discovery},
author = {Sergi Nadal and Raquel Panadero and Javier Flores and Oscar Romero},
journal= {arXiv preprint arXiv:2305.19629},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2012.00890