通过深度学习与统计模型提升数据质量
人工智能
2018-10-17 v1 机器学习
摘要
传统的数据质量控制方法基于用户经验或先前建立的商业规则,这不仅限制了性能,而且是一个耗时较长且准确率不尽如人意的过程。利用深度学习,我们可以借助计算资源和先进技术克服这些挑战,并为用户创造更大价值。在本文中,我们作者首先回顾相关工作并讨论机器学习技术、工具以及统计质量模型。其次,我们提出一种基于深度学习与统计模型算法的创造性数据质量框架,用于识别数据质量。第三,我们使用来自阿肯色州发布的开放数据集中涉及薪资水平的数据,演示如何识别离群数据以及如何通过深度学习改善数据质量。最后,我们讨论了未来的工作。
引用
@article{arxiv.1810.07132,
title = {Improving Data Quality through Deep Learning and Statistical Models},
author = {Wei Dai and Kenji Yoshigoe and William Parsley},
journal= {arXiv preprint arXiv:1810.07132},
year = {2018}
}
备注
8 pages, 6 figures, and 3 tables