中文

工业机器学习项目中采用自动化数据验证的经验

软件工程 2021-03-09 v1

摘要

背景:数据错误是机器学习(ML)项目中常见的挑战,通常会导致 ML 赋能软件系统的性能显著下降。为了及早发现错误数据并避免使用坏数据训练 ML 模型,研究与工业实践建议在 ML 系统开发过程中引入数据验证流程和工具。目的:本研究调查了工业 ML 项目中数据验证流程和工具的采用情况。数据验证流程在工具开发和维护上需要大量工程资源。因此,尤其对于处于部署 ML 赋能软件系统早期阶段的开发团队,识别其采用的最佳实践十分重要。方法:在一家大型软件密集型电信组织中开展了行动研究,具体位于分析研发组织内,针对一个对退回的硬件电信设备进行分类的 ML 用例。结果:基于评估结果和行动研究的经验,我们识别了在工业 ML 项目中采用数据验证流程和工具的三项最佳实践、三项益处和两个障碍。我们还提出了一个数据验证框架(DVF)以系统化数据验证流程的采用。结论:结果表明,在 ML 项目中采用数据验证流程和工具是测试 ML 赋能软件系统的有效方法。它需要概览可应用特定数据质量测试的数据层级(特征、数据集、跨数据集、数据流)。

关键词

引用

@article{arxiv.2103.04095,
  title  = {On the experiences of adopting automated data validation in an industrial machine learning project},
  author = {Lucy Ellen Lwakatare and Ellinor Rånge and Ivica Crnkovic and Jan Bosch},
  journal= {arXiv preprint arXiv:2103.04095},
  year   = {2021}
}

备注

SEIP 2021 Conference