PeaTMOSS:开源软件中预训练模型的挖掘
软件工程
2023-10-06 v1 人工智能
摘要
开发和训练深度学习模型代价高昂,因此软件工程师已开始复用预训练深度学习模型(PTM)并对其进行微调以用于下游任务。尽管 PTM 已被广泛使用,我们对其相应的软件工程行为与挑战仍知之甚少。为支持基于 PTM 的软件工程研究,我们提出 PeaTMOSS 数据集:开源软件中的预训练模型(Pre-Trained Models in Open-Source Software)。PeaTMOSS 包含三部分:(1) 281,638 个 PTM 的快照,(2) 27,270 个使用 PTM 的开源软件仓库,以及 (3) PTM 与使用它们的项目之间的映射。我们呼吁 PeaTMOSS 挖掘者发现围绕 PTM 的软件工程实践。演示及完整数据集链接见:https://github.com/PurdueDualityLab/PeaTMOSS-Demos。
引用
@article{arxiv.2310.03620,
title = {PeaTMOSS: Mining Pre-Trained Models in Open-Source Software},
author = {Wenxin Jiang and Jason Jones and Jerin Yasmin and Nicholas Synovic and Rajeev Sashti and Sophie Chen and George K. Thiruvathukal and Yuan Tian and James C. Davis},
journal= {arXiv preprint arXiv:2310.03620},
year = {2023}
}