Vamsa:数据科学脚本中的自动化溯源追踪
机器学习
2020-07-31 v2 分布式、并行与集群计算
机器学习
摘要
由于各类机器学习(ML)应用自身显而易见或监管的要求,近期在 ML 模型的公平性、偏差与可解释性方面已有大量持续研究。我们作出如下观察:所有这些方法都需要稳健地理解 ML 模型与用于训练它们的数据之间的关系。本工作中,我们引入 ML 溯源追踪问题:其基本思想是自动追踪数据集中哪些列被用于推导 ML 模型的特征/标签。我们讨论了在 Python(数据科学家最常用的语言)上下文中捕获此类信息所面临的挑战。随后我们提出 Vamsa,一个无需对用户代码作任何修改即可从 Python 脚本中提取溯源信息的模块化系统。利用 26K 个真实数据科学脚本,我们验证了 Vamsa 在覆盖率与性能方面的有效性。我们还在较小规模的人工标注数据子集上评估了 Vamsa 的准确率。分析表明,Vamsa 的精确率与召回率介于 90.4% 至 99.1% 之间,对平均规模脚本的延迟为毫秒级。基于我们在生产环境中部署 ML 模型的经验,我们还给出一个示例,说明 Vamsa 如何自动识别受数据损坏问题影响的模型。
引用
@article{arxiv.2001.01861,
title = {Vamsa: Automated Provenance Tracking in Data Science Scripts},
author = {Mohammad Hossein Namaki and Avrilia Floratou and Fotis Psallidas and Subru Krishnan and Ashvin Agrawal and Yinghui Wu and Yiwen Zhu and Markus Weimer},
journal= {arXiv preprint arXiv:2001.01861},
year = {2020}
}