中文

Hugging Face 上机器学习模型与数据集文档、供应链及许可挑战的实证分析

软件工程 2025-09-30 v2 机器学习

摘要

过去十年中,机器学习(ML)组件在软件系统中得到了广泛采用。这几乎发生在每个领域,从自然语言处理到计算机视觉。这些 ML 组件涵盖了从相对简单的神经网络到复杂且资源密集型的大语言模型。然而,尽管得到了广泛采用,人们对产生这些模型的供应链关系知之甚少,这可能对合规性和安全性产生影响。在这项工作中,我们对从流行的模型共享网站 Hugging Face 提取的 760,460 个模型和 175,000 个数据集进行了广泛分析。首先,我们评估了 Hugging Face 供应链中文档的现状,报告了缺陷的真实案例,并提供了可操作的改进建议。接下来,我们分析了现有供应链的底层结构。最后,我们对照先前工作中报告的内容探索了当前的许可环境,并讨论了该领域面临的独特挑战。我们的结果激发了多个研究途径,包括需要为 ML 模型/数据集提供更好的许可管理、为模型文档提供更好的支持,以及自动化的不一致性检查和验证。我们公开了我们的研究基础设施和数据集,以促进未来的研究。

关键词

引用

@article{arxiv.2502.04484,
  title  = {An Empirical Analysis of Machine Learning Model and Dataset Documentation, Supply Chain, and Licensing Challenges on Hugging Face},
  author = {Trevor Stalnaker and Nathan Wintersgill and Oscar Chaparro and Laura A. Heymann and Massimiliano Di Penta and Daniel M German and Denys Poshyvanyk},
  journal= {arXiv preprint arXiv:2502.04484},
  year   = {2025}
}