通过逻辑查询计划对原生 ML 流水线进行仪器化与分析
数据库
2024-09-04 v1 机器学习
软件工程
摘要
机器学习 (ML) 越来越多地用于自动化产生重大决策,这引发对其正确性、可靠性和公平性的关注。我们设想高度自动化的软件平台以帮助数据科学家开发、验证、监控和分析其 ML 流水线。与现有工作不同,我们的核心思想是从 ML 流水线代码中提取“逻辑查询计划”,这些计划基于流行的库。基于这些计划,我们自动推断流水线语义,并对 ML 流水线进行仪器化和重写,以支持各种用例,而无需数据科学家手动标注或重写其代码。首先,我们开发了这种抽象 ML 流水线表示及从 Python 代码中提取它的机制。接下来,我们利用该表示对静态 ML 流水线进行高效仪器化并应用源代码跟踪,这实现了对常见数据准备问题的轻量级筛查。最后,我们构建了机器用于自动重写 ML 流水线以执行更高级的 what-if 分析,并提出对 resulting workloads 采用多查询优化。在未来工作中,我们旨在在数据科学家处理其 ML 流水线时进行交互式辅助。
关键词
引用
@article{arxiv.2407.07560,
title = {Instrumentation and Analysis of Native ML Pipelines via Logical Query Plans},
author = {Stefan Grafberger},
journal= {arXiv preprint arXiv:2407.07560},
year = {2024}
}