软件依赖 2.0:开源项目中预训练模型复用与集成的实证研究
软件工程
2026-02-19 v2 人工智能
摘要
预训练模型(PTMs)是经过预先训练的机器学习模型,通常在大规模数据上训练,可复用于新任务,从而减少从头开始训练的高昂成本。其广泛采用引入了一类新的软件依赖,我们称之为软件依赖 2.0,超越了传统库,延伸至训练模型及其相关产物中体现的已学行为。PTMs 作为软件依赖在真实项目中的集成方式仍不明确,可能威胁日益依赖它们的现代软件系统的可维护性和可靠性。目标:本研究通过考察 PTMs 的复用,调查开源软件(OSS)项目中的软件依赖 2.0,重点关注开发者如何管理和集成这些模型。具体而言,我们旨在理解:(1)OSS 项目如何构建和记录其 PTM 依赖;(2)PTM 复用流水线中出现了哪些阶段和组织模式;以及(3)各流水线阶段中 PTMs 与其他已学组件之间的交互。我们对 PeaTMOSS 数据集(28,575 个复用 Hugging Face 和 PyTorch Hub 上 PTMs 的 GitHub 仓库)中统计显著的随机样本 401 个仓库进行了混合方法分析。我们通过识别模式定量考察 PTM 复用,并通过定性方法调查开发者在实践中如何集成和管理这些模型。
引用
@article{arxiv.2509.06085,
title = {Software Dependencies 2.0: An Empirical Study of Reuse and Integration of Pre-Trained Models in Open-Source Projects},
author = {Jerin Yasmin and Wenxin Jiang and James C. Davis and Yuan Tian},
journal= {arXiv preprint arXiv:2509.06085},
year = {2026}
}
备注
Submitted to Empirical Software Engineering (EMSE) Journal