中文

基于端到端机器学习流水线中 Shapley 重要性的数据调试

机器学习 2022-04-28 v2 人工智能 数据库

摘要

现代机器学习(ML)应用的开发是以数据为中心的,其中一个根本挑战是理解数据质量对 ML 训练的影响——"哪些训练样本‘导致’训练出的 ML 模型预测不准确或不公平?" 对 ML 训练的数据影响建模在过去十年引起了广泛关注,一个流行的框架是计算各训练样本相对于验证准确率与训练 ML 模型公平性等效用的 Shapley 值。遗憾的是,尽管近期关注与研究密集,现有方法仅考虑“孤立的”单一 ML 模型,而未考虑由数据变换、特征提取器与 ML 训练构成的端到端 ML 流水线。我们提出 DataScope(ease.ml/datascope),首个高效计算端到端 ML 流水线上训练样本 Shapley 值的系统,并展示其在 ML 训练数据调试中的应用。为此,我们首先开发了一种新颖算法框架,计算一类称为规范流水线的特定 ML 流水线上的 Shapley 值:一个正关系代数查询后接 K 近邻(KNN)分类器。我们表明,对于规范流水线的许多子族,计算 Shapley 值处于 PTIME,与一般情况下计算 Shapley 值的指数复杂度形成对比。随后我们将其付诸实践——给定一个 sklearn 流水线,我们用规范流水线近似它作为代理。我们进行了大量实验以展示不同用例与效用。结果表明,DataScope 比当前最优的基于蒙特卡洛的方法快多达四个数量级,同时在数据调试中效果相当甚至往往更优。

关键词

引用

@article{arxiv.2204.11131,
  title  = {Data Debugging with Shapley Importance over End-to-End Machine Learning Pipelines},
  author = {Bojan Karlaš and David Dao and Matteo Interlandi and Bo Li and Sebastian Schelter and Wentao Wu and Ce Zhang},
  journal= {arXiv preprint arXiv:2204.11131},
  year   = {2022}
}