面向目标精度的数据清洗:以值归一化为例
数据库
2021-01-15 v1
摘要
许多应用需要用达到目标精度的数据清洗。据我们所知,该问题尚未被深入研究。本文朝解决该问题迈出第一步。我们聚焦于值归一化 (VN),即用唯一字符串替换所有指向同一实体的字符串的问题。VN 无处不在,且我们常希望以 100% 精度完成 VN。当前工业界典型做法是自动聚类字符串,再请用户核验并清洗聚类,直至达到 100% 精度。该方案存在显著局限:它未告知用户如何核验与清洗聚类;此部分常耗时良久,例如数天;此外,缺乏多用户协同核验与清洗的有效途径。本文应对这些挑战。总体而言,我们的工作通过引入一种新颖清洗问题并给出有前景的解决方案模板,推进了数据清洗的技术水平。
引用
@article{arxiv.2101.05308,
title = {Toward Data Cleaning with a Target Accuracy: A Case Study for Value Normalization},
author = {Adel Ardalan and Derek Paulsen and Amanpreet Singh Saini and Walter Cai and AnHai Doan},
journal= {arXiv preprint arXiv:2101.05308},
year = {2021}
}