中文

一种数据质量度量(DQM):如何估计数据集中未检测到的错误数量

数据库 2017-05-30 v3

摘要

数据清洗,无论是手动还是算法驱动,很少能达到完美,清洗后的数据集总会留下数量未知的假阳性和假阴性错误。在许多场景中,量化剩余错误的数量具有挑战性,因为我们的数据完整性规则本身可能不完整,或者可用的黄金标准数据集可能太小而无法进行外推。随着本质上易出错的人群在数据清洗问题中的应用日益普遍,拥有能够量化此类错误程度的估计器变得非常重要。我们提出了新颖的物种估计器,用于估计数据集在经过一组众包工作者清洗后,其中剩余的不同错误的数量——本质上,是量化雇佣额外工作者来清洗数据集的效用。这个问题需要能够对假阳性和假阴性具有鲁棒性的新估计器,我们通过三个真实世界的数据集实证表明,现有的物种估计器对于此问题是不稳定的,而我们提出的技术能快速收敛。

关键词

引用

@article{arxiv.1611.04878,
  title  = {A Data Quality Metric (DQM): How to Estimate The Number of Undetected Errors in Data Sets},
  author = {Yeounoh Chung and Sanjay Krishnan and Tim Kraska},
  journal= {arXiv preprint arXiv:1611.04878},
  year   = {2017}
}

备注

To appear in VLDB 2017