中文

通过深度学习与统计模型提升数据质量

人工智能 2018-10-17 v1 机器学习

摘要

传统的数据质量控制方法基于用户经验或先前建立的商业规则,这不仅限制了性能,而且是一个耗时较长且准确率不尽如人意的过程。利用深度学习,我们可以借助计算资源和先进技术克服这些挑战,并为用户创造更大价值。在本文中,我们作者首先回顾相关工作并讨论机器学习技术、工具以及统计质量模型。其次,我们提出一种基于深度学习与统计模型算法的创造性数据质量框架,用于识别数据质量。第三,我们使用来自阿肯色州发布的开放数据集中涉及薪资水平的数据,演示如何识别离群数据以及如何通过深度学习改善数据质量。最后,我们讨论了未来的工作。

关键词

引用

@article{arxiv.1810.07132,
  title  = {Improving Data Quality through Deep Learning and Statistical Models},
  author = {Wei Dai and Kenji Yoshigoe and William Parsley},
  journal= {arXiv preprint arXiv:1810.07132},
  year   = {2018}
}

备注

8 pages, 6 figures, and 3 tables