ActiveClean:学习凸损失模型时的交互式数据清洗
数据库
2016-01-18 v1 机器学习
摘要
数据清洗通常是确保预测模型(如回归和分类)不受系统性错误(如不一致、过时或离群数据)影响的重要步骤。识别脏数据通常是手动且迭代的过程,在大型数据集上可能具有挑战性。然而,许多数据清洗工作流可能因违反独立性假设而将微妙偏差引入训练过程。我们提出 ActiveClean,一种渐进式清洗方法,其中模型被增量更新而非重新训练,并且能保证在部分清洗数据上的准确性。ActiveClean 支持一类称为凸损失模型(例如线性回归和 SVMs)的流行模型。ActiveClean 还利用用户模型的结构来优先清洗那些可能影响结果的记录。我们在五个真实世界数据集 UCI Adult、UCI EEG、MNIST、Dollars For Docs 和 WorldBank 上评估 ActiveClean,包含真实和合成错误。我们的结果表明,我们提出的优化可以在相同清洗数据量下将模型准确性提高至多 2.5 倍。此外,在固定清洗预算下且在所有真实脏数据集上,ActiveClean 返回比均匀采样和主动学习更准确的模型。
引用
@article{arxiv.1601.03797,
title = {ActiveClean: Interactive Data Cleaning While Learning Convex Loss Models},
author = {Sanjay Krishnan and Jiannan Wang and Eugene Wu and Michael J. Franklin and Ken Goldberg},
journal= {arXiv preprint arXiv:1601.03797},
year = {2016}
}
备注
Pre-print