估计未知的未知对聚合查询结果的影响
数据库
2015-12-29 v3
摘要
数据科学家通常的做法是获取并集成不同的数据源以获得更高质量的结果。但即使拥有一个完美清洗和合并的数据集,两个基本问题仍然存在:(1) 集成数据集是否完整?(2) 任何未知(即未观测到的)数据对查询结果有何影响?在这项工作中,我们开发并分析了估计未知数据(又称未知的未知)对简单聚合查询影响的技术。核心思想是,不同数据源之间的重叠使我们能够估计缺失数据项的数量和值。我们的主要技术是无参数的,并且不假设关于分布的先验知识。通过一系列实验,我们表明估计未知的未知的影响对于更好地评估集成数据源上的聚合查询结果是非常宝贵的。
引用
@article{arxiv.1507.05591,
title = {Estimating the Impact of Unknown Unknowns on Aggregate Query Results},
author = {Yeounoh Chung and Michael Lind Mortensen and Carsten Binnig and Tim Kraska},
journal= {arXiv preprint arXiv:1507.05591},
year = {2015}
}