中文

迈向 Hugging Face 上开放预训练语言模型发布的语义化版本控制

软件工程 2025-02-20 v3

摘要

Hugging Face (HF) 等模型注册平台上开放预训练语言模型 (PTLMs) 的激增,为围绕其构建产品的公司既带来了机遇,也带来了挑战。与传统的软件依赖类似,PTLMs 在发布后仍会继续演进。然而,目前模型注册平台上 PTLMs 的发布实践受到各种不一致性的困扰,例如命名约定模糊和模型训练文档不可访问。鉴于当前 PTLM 发布实践方面的知识空白,我们的实证研究采用混合方法,分析了最知名的模型注册平台 HF 上 52,227 个 PTLMs 的发布情况。我们的结果揭示了 PTLM 发布的 148 种不同命名实践,其中 40.87% 的模型权重文件更改未反映在所采用的基于名称的版本控制实践或其文档中。此外,我们发现这 52,227 个 PTLMs 仅派生自 299 个不同的基础模型(用于创建这 52,227 个 PTLMs 的经修改的原始模型),其中微调和量化是应用于这些基础模型的最普遍的修改方法。在训练数据集规范和模型卡可用性方面,发布透明度仍存在显著差距,凸显了对标准化文档的需求。虽然我们发现了一种明确区分 PTLM 主要和次要发布的模型命名实践,但我们没有发现这两种发布类型中所包含的更改类型存在任何显著差异,这表明 PTLMs 的主/次版本号通常是任意选择的。我们的发现为改进 PTLM 发布实践提供了有价值的见解,推动该领域向更正式的语义化版本控制实践发展。

关键词

引用

@article{arxiv.2409.10472,
  title  = {Towards Semantic Versioning of Open Pre-trained Language Model Releases on Hugging Face},
  author = {Adekunle Ajibode and Abdul Ali Bangash and Filipe Roseiro Cogo and Bram Adams and Ahmed E. Hassan},
  journal= {arXiv preprint arXiv:2409.10472},
  year   = {2025}
}