中文

面向软件工程的开源机器学习模型与数据集分类研究

软件工程 2024-11-15 v1 人工智能 机器学习

摘要

背景:开源预训练模型(PTMs)和数据集为各种机器学习(ML)任务提供了丰富资源,但这些资源缺乏针对软件工程(SE)需求的分类。目的:我们将面向SE的分类应用于流行开源ML仓库Hugging Face(HF)上的PTMs和数据集,并分析PTMs随时间的演变。方法:我们进行了一项仓库挖掘研究。我们从HF API系统收集的PTMs和数据集数据库开始。通过分析模型卡片和数据集卡片及元数据(如标签),并使用Gemini 1.5 Pro确认SE相关性,我们优化了选择。所有分析均可复现,并提供公开可访问的复现包。结果:PTMs和数据集中最常见的SE任务是代码生成,主要关注软件开发,对软件管理关注有限。流行的PTMs和数据集主要针对软件开发。在ML任务中,文本生成是SE PTMs和数据集中最常见的。自2023年第二季度以来,面向SE的PTMs显著增加。结论:该研究凸显了需要更广泛的任务覆盖,以增强ML在SE实践中的集成。

关键词

引用

@article{arxiv.2411.09683,
  title  = {Towards a Classification of Open-Source ML Models and Datasets for Software Engineering},
  author = {Alexandra González and Xavier Franch and David Lo and Silverio Martínez-Fernández},
  journal= {arXiv preprint arXiv:2411.09683},
  year   = {2024}
}

备注

5 pages, 8 figures