中文

yProv4ML:面向机器学习系统的无感化数据溯源框架

机器学习 2025-07-03 v1 分布式、并行与集群计算

摘要

大型语言模型(LLM)的快速兴趣增长反映了其在灵活性和泛化能力方面的潜力,吸引了广泛的研究者关注。然而,这些技术的出现也凸显了开发过程缺乏透明性和严谨性的问题。特别是无法提前确定 epoch 数目和其他超参数,给确定最佳模型带来了挑战。为此,诸如 MLFlow 等机器学习框架可自动收集此类信息。然而,这些工具使用专有格式来捕获数据,几乎不关注数据血缘。本文提出了 yProv4ML,一个在机器学习过程中捕获 PROV-JSON 格式 provenance 信息的框架,需进行最小的代码修改。

关键词

引用

@article{arxiv.2507.01078,
  title  = {yProv4ML: Effortless Provenance Tracking for Machine Learning Systems},
  author = {Gabriele Padovani and Valentine Anantharaj and Sandro Fiore},
  journal= {arXiv preprint arXiv:2507.01078},
  year   = {2025}
}