基于距离的数据清洗:一项综述(技术报告)
数据库
2020-11-24 v1
摘要
随着互联网技术的快速发展,脏数据在各种实际场景中普遍存在,例如由于不可靠的传感器读数、来自异构源的传输与采集。为应对其对下游应用的负面影响,数据清洗方法被设计用于在应用前对脏数据进行预处理。大多数数据清洗方法的思路是参照共享相同信息的邻居的取值来识别或纠正脏数据。遗憾的是,由于数据稀疏性与异构性,基于相等关系的邻居数量相当有限,尤其在存在取值差异的情况下。为解决此问题,基于距离的数据清洗方法提出基于取值距离来考虑相似邻居。通过对微小变异的容忍,可识别出丰富的相似邻居并用于数据清洗任务。同时,元组间的距离关系也有助于指导数据清洗,其包含更多信息且涵盖了相等关系。因此,基于距离的技术在数据清洗领域发挥着重要作用,我们也有理由相信基于距离的数据清洗技术未来将在数据预处理研究中吸引更多关注。故此综述对四类主要数据清洗任务(即规则剖析、错误检测、数据修复与数据填补)进行了分类,并全面回顾了每一类的当前最优方法。
引用
@article{arxiv.2011.11176,
title = {Distance-based Data Cleaning: A Survey (Technical Report)},
author = {Yu Sun and Jian Zhang},
journal= {arXiv preprint arXiv:2011.11176},
year = {2020}
}