通过修复数据集来修复你的模型
机器学习
2021-12-16 v1
摘要
底层训练数据的质量对于构建具有更广泛泛化能力的性能优异的机器学习模型至关重要。然而,当前的机器学习(ML)工具缺乏用于提升数据质量的 streamlined 流程。因此,获取数据质量洞察并迭代地修剪错误以获得最能代表下游用例的数据集,仍然是一个临时的手动过程。我们的工作解决了这一数据工具缺口,该缺口是通过以数据为中心的技术构建改进型 ML 工作流所必需的。更具体地说,我们引入了一个系统性框架,用于(1)发现数据集中有噪声或错误标注的样本,以及(2)识别信息量最大的样本,这些样本若纳入训练将带来最大的模型性能提升。我们在公共数据集以及两家《财富》500强公司的私有企业数据集上展示了我们框架的有效性,并相信这项工作将构成 ML 团队执行更智能的数据发现与修剪的基础。
引用
@article{arxiv.2112.07844,
title = {Fix your Models by Fixing your Datasets},
author = {Atindriyo Sanyal and Vikram Chatterji and Nidhi Vyas and Ben Epstein and Nikita Demir and Anthony Corletti},
journal= {arXiv preprint arXiv:2112.07844},
year = {2021}
}