中文

以细粒度溯源更好洞察数据科学流水线

数据库 2024-04-08 v1

摘要

成功的数据驱动科学需要复杂的数据工程流水线来清洗、转换和修改数据,为机器学习做准备,而只有当流水线中每一步都可被证明合理、其对数据的影响可被解释时,才能获得稳健的结果。在此框架下,我们的目标是为数据科学家提供工具,以深入理解从原始输入到可用于学习的训练集的流水线每一步如何影响数据。从数据科学环境中常用的一组可扩展的数据准备算子出发,本文提出了一种溯源管理基础设施,用于生成、存储和查询非常细粒度的数据转换记录,尽可能到数据集中单个元素的层面。然后,从一组核心数据科学预处理算子的形式化定义出发,我们推导出一种由 PROV(数据溯源标准模型)表达的模板集合所体现的溯源语义。以这些模板为参考,我们的溯源生成算法可推广到任何具有可观测输入/输出对的算子。我们提供了一个应用层溯源捕获库的原型实现,以半自动方式生成记录整个流水线的完整溯源文档。我们报告了我们的实现在真实 ML 基准流水线和 TCP-DI 合成数据上捕获溯源的能力。最后,我们展示了所收集的溯源如何用于回答一系列溯源基准查询,这些查询支撑了数据科学堆栈交换上表达的一些常见流水线检查问题。

关键词

引用

@article{arxiv.2310.18079,
  title  = {Supporting Better Insights of Data Science Pipelines with Fine-grained Provenance},
  author = {Adriane Chapman and Luca Lauro and Paolo Missier and Riccardo Torlone},
  journal= {arXiv preprint arXiv:2310.18079},
  year   = {2024}
}

备注

37 pages, 27 figures, submitted to a journal