Picket:在表格数据学习与推理过程中防范 corrupted 数据
机器学习
2021-07-27 v3 机器学习
摘要
数据损坏是现代机器学习部署的一大障碍。损坏的数据会严重偏置所学模型,并导致无效的推理。我们提出 Picket,一个简单框架,用于在表格数据上机器学习模型的训练和部署期间防范数据损坏。在训练阶段,Picket 从训练数据中识别并移除损坏的数据点,以避免获得偏置模型。在部署阶段,Picket 以在线方式标记那些因噪声将导致预测错误的、发送给已训练机器学习模型的损坏查询点。为检测损坏数据,Picket 使用了一种用于混合类型表格数据的自监督深度学习模型,我们称之为 PicketNet。为最小化部署负担,学习 PicketNet 模型不需要任何人工标注数据。Picket 被设计为可提升任意机器学习流水线鲁棒性的插件。我们在多种真实世界数据上评估 Picket,考虑了包含训练与测试期间系统性及对抗性噪声的不同损坏模型。我们表明,Picket 在从 SVM 到神经网络的各种模型的训练与部署期间始终防范损坏数据,优于从数据质量验证模型到鲁棒离群点检测模型的一系列竞争方法。
引用
@article{arxiv.2006.04730,
title = {Picket: Guarding Against Corrupted Data in Tabular Data during Learning and Inference},
author = {Zifan Liu and Zhechun Zhou and Theodoros Rekatsinas},
journal= {arXiv preprint arXiv:2006.04730},
year = {2021}
}
备注
23 pages, 24 figures