yProv4ML:面向机器学习系统的无感化数据溯源框架
机器学习
2025-07-03 v1 分布式、并行与集群计算
摘要
大型语言模型(LLM)的快速兴趣增长反映了其在灵活性和泛化能力方面的潜力,吸引了广泛的研究者关注。然而,这些技术的出现也凸显了开发过程缺乏透明性和严谨性的问题。特别是无法提前确定 epoch 数目和其他超参数,给确定最佳模型带来了挑战。为此,诸如 MLFlow 等机器学习框架可自动收集此类信息。然而,这些工具使用专有格式来捕获数据,几乎不关注数据血缘。本文提出了 yProv4ML,一个在机器学习过程中捕获 PROV-JSON 格式 provenance 信息的框架,需进行最小的代码修改。
引用
@article{arxiv.2507.01078,
title = {yProv4ML: Effortless Provenance Tracking for Machine Learning Systems},
author = {Gabriele Padovani and Valentine Anantharaj and Sandro Fiore},
journal= {arXiv preprint arXiv:2507.01078},
year = {2025}
}