中文

面向 Web 数据的贝叶斯数据清洗

数据库 2012-04-18 v1 信息检索

摘要

数据清洗是一个长期存在的问题,随着大量未策展 Web 数据的出现,其重要性日益增长。处理不一致数据的最新方法是学习并使用条件函数依赖 (CFDs) 来修正数据的系统。这些方法从数据的干净样本中学习数据模式(即 CFDs),并用它们来修正脏/不一致数据。虽然在企业数据场景中获取干净的训练样本是可行的,但在没有单独策展数据的 Web 数据库中则不可行。基于 CFD 的方法不幸对噪声特别敏感;我们将通过实证证明,即使只有少量噪声,学习到的 CFD 数量也会急剧下降。为了克服这一局限性,我们提出了一种完全概率化的数据清洗框架。我们的方法涉及学习数据的生成模型和误差(损坏)模型,并利用它们来清洗数据。对于生成模型,我们从数据中学习贝叶斯网络。对于误差模型,我们考虑使用最大熵框架来组合多个误差过程。生成模型和误差模型直接从噪声数据中学习。我们介绍了该框架的详细信息,并展示了其在修正 Web 数据方面的有效性。

关键词

引用

@article{arxiv.1204.3677,
  title  = {Bayesian Data Cleaning for Web Data},
  author = {Yuheng Hu and Sushovan De and Yi Chen and Subbarao Kambhampati},
  journal= {arXiv preprint arXiv:1204.3677},
  year   = {2012}
}

备注

6 pages, 7 figures