中文

Auto-Validate:利用从数据湖推断的数据域模式进行无监督数据验证

数据库 2021-04-14 v2 人工智能

摘要

复杂数据管道在BI报告和ML建模等多种应用中日益普遍。这些管道经常定期重复(例如每日或每周),因为BI报告需要刷新,且ML模型需要重新训练。然而,广泛报道表明,在复杂生产管道中,上游数据馈送可能以意外方式发生变化,导致下游应用静默中断,其修复代价高昂。因此,数据验证已成为一个重要课题,谷歌和亚马逊近期值得注意的努力便是证明,其目标是在数据质量问题于管道中出现时尽早捕获。然而,我们在生产数据上的经验表明,对于字符串值数据,这些现有方法会产生高误报率,并且经常需要人工干预。在这项工作中,我们开发了一种语料库驱动的方法,通过推断准确描述底层数据域的合适数据验证“模式”来自动验证\emph{机器生成数据},从而在最大化捕获数据质量问题的同时最小化误报。使用来自真实数据湖的生产数据进行的评估表明,Auto-Validate比现有方法显著更有效。该技术的一部分作为Auto-Tag功能在Microsoft Azure Purview中发布。

关键词

引用

@article{arxiv.2104.04659,
  title  = {Auto-Validate: Unsupervised Data Validation Using Data-Domain Patterns Inferred from Data Lakes},
  author = {Jie Song and Yeye He},
  journal= {arXiv preprint arXiv:2104.04659},
  year   = {2021}
}

备注

full version of a SIGMOD 2021 paper