中文

PeaTMOSS:开源软件中预训练模型的数据集与初步分析

软件工程 2024-02-02 v1 人工智能 数据库 机器学习

摘要

深度学习模型的开发和训练变得越来越昂贵和复杂。因此,软件工程师正在为其下游应用采用预训练模型(PTM)。PTM供应链的动态在很大程度上仍未探索,这明确表明需要结构化的数据集,不仅记录元数据,还记录这些模型的后续应用。没有这样的数据,软件仓库挖掘(MSR)社区就无法全面理解PTM采用和重用的影响。本文介绍了PeaTMOSS数据集,该数据集包含281,638个PTM的元数据,以及所有月下载量超过50次的PTM(14,296个PTM)的详细快照,以及来自GitHub的28,575个使用这些模型的开源软件仓库。此外,该数据集包括从15,129个下游GitHub仓库到它们使用的2,530个PTM的44,337个映射。为了增强数据集的全面性,我们开发了用于大型语言模型的提示,以自动提取模型元数据,包括模型的训练数据集、参数和评估指标。我们对该数据集的分析提供了PTM供应链的首次汇总统计,显示了PTM开发的趋势和PTM包文档的常见缺陷。我们的示例应用揭示了PTM及其依赖项目之间软件许可证的不一致性。PeaTMOSS为未来研究奠定了基础,为调查PTM供应链提供了丰富的机会。我们概述了关于PTM、其下游使用以及跨领域问题的挖掘机会。

关键词

引用

@article{arxiv.2402.00699,
  title  = {PeaTMOSS: A Dataset and Initial Analysis of Pre-Trained Models in Open-Source Software},
  author = {Wenxin Jiang and Jerin Yasmin and Jason Jones and Nicholas Synovic and Jiashen Kuo and Nathaniel Bielanski and Yuan Tian and George K. Thiruvathukal and James C. Davis},
  journal= {arXiv preprint arXiv:2402.00699},
  year   = {2024}
}

备注

Accepted at MSR'24