通过数据质量分析实现ML自动可行性研究:以标签噪声为例
机器学习
2022-08-31 v4
摘要
在我们与使用当今AutoML系统的领域专家合作的经验中,遇到的一个常见问题是我们称之为“不切实际的期望”——当用户面对具有噪声数据获取过程的极具挑战性任务时,却期望通过机器学习(ML)达到惊人的高准确率。其中许多从一开始就注定失败。在传统软件工程中,该问题通过可行性研究来解决,这是开发任何软件系统前不可或缺的一步。在本文中,我们提出Snoopy,旨在支持数据科学家和机器学习工程师在构建ML应用前进行系统且有理论依据的可行性研究。我们通过估计底层任务的不可约误差(也称为贝叶斯误差率(BER))来解决此问题,该误差源于用于训练或评估ML模型产物的数据集中的数据质量问题。我们设计了一个实用的贝叶斯误差估计器,并在计算机视觉和自然语言处理的6个数据集(带有不同级别的额外真实和合成噪声)上与基线可行性研究候选方法进行比较。此外,通过将我们的系统可行性研究与额外信号纳入迭代标签清洗过程,我们在端到端实验中展示了用户如何能够节省大量的标注时间和经济成本。
引用
@article{arxiv.2010.08410,
title = {Automatic Feasibility Study via Data Quality Analysis for ML: A Case-Study on Label Noise},
author = {Cedric Renggli and Luka Rimanic and Luka Kolar and Wentao Wu and Ce Zhang},
journal= {arXiv preprint arXiv:2010.08410},
year = {2022}
}