中文

当AI模型成为依赖项:研究下游软件系统中预训练模型复用的演化

软件工程 2026-04-21 v1

摘要

现代软件系统已从纯代码架构转变为AI集成系统,其中预训练模型(PTM)作为永久性依赖项。然而,虽然传统软件库的演化已有详细记录,但我们缺乏对这些“PTM依赖项”随时间如何变化的清晰理解。与库不同,PTM的特点是内部不透明、发布周期标准化程度低且快速演化。此外,其多角色性质使得开发者能够根据特定的下游任务,将单个PTM的多个实例视为独立的功能依赖项。这给软件维护提出了一个关键问题:PTM的变化是否像标准软件库一样,还是遵循一种不同的模式?为了回答这个问题,我们首次对下游PTM变化进行了实证研究,分析了323个重用开源PTM的GitHub OSS仓库中的4988个版本的综合数据集。以传统软件库为基线,我们发现PTM遵循一种性质上不同的模式。PTM通常在项目生命周期后期被添加,并且随着项目成熟,它们倾向于累积而非被替换。我们的发现表明,PTM变化的频率(406次版本过渡中有变化)是库变化的三分之一。PTM变化在常规文档中记录较少,但更可能带有明确的理由。与被动演化的库不同,PTM的演化是由能力扩展主动驱动的,并带有独特的PTM测试不确定性的记录理由。我们的工作呼吁重新思考在现代软件工程中如何将PTM作为依赖项进行跟踪和管理。

关键词

引用

@article{arxiv.2604.17940,
  title  = {When AI Models Become Dependencies: Studying the Evolution of Pre-Trained Model Reuse in Downstream Software Systems},
  author = {Peerachai Banyongrakkul and Mansooreh Zahedi and Christoph Treude and Haoyu Gao and Patanamon Thongtanunam},
  journal= {arXiv preprint arXiv:2604.17940},
  year   = {2026}
}

备注

This work has been submitted to the IEEE Transactions on Software Engineering (TSE) for possible publication