中文

面向软件工程的预训练模型自动分类:以 Hugging Face 数据集为案例研究

软件工程 2024-05-24 v1

摘要

软件工程(SE)活动已被预训练模型(PTMs)所革新,这些模型是能够针对特定 SE 任务进行微调的大型机器学习(ML)模型。然而,缺乏专业知识的用户可能需要帮助选择适合当前任务的模型。为解决此问题,Hugging Face(HF)平台通过收集、存储和策划几个模型来简化 PTMs 的使用。尽管如此,平台目前缺乏专为 SE 任务设计的 PTMs 完整分类,即现有的标签更适合通用 ML 类别。本文提出了一种方法来解决这一差距,通过启用 PTMs 对 SE 任务的自动分类。首先,我们利用 HF 的公开数据提取 PTMs 信息,包括模型文档和关联标签。随后,我们采用半自动方法识别 SE 任务及其对应的 PTMs。该方法涉及创建 HF 标签与特定 SE 任务之间的初始映射,利用基于相似性的策略识别具有相关标签的 PTMs。评估显示,模型卡足够信息丰富,可考虑 pipeline 标签对 PTMs 进行分类。此外,我们通过依赖模型名称提供一种 SE 任务与存储 PTMs 之间的映射。

关键词

引用

@article{arxiv.2405.13185,
  title  = {Automated categorization of pre-trained models for software engineering: A case study with a Hugging Face dataset},
  author = {Claudio Di Sipio and Riccardo Rubei and Juri Di Rocco and Davide Di Ruscio and Phuong T. Nguyen},
  journal= {arXiv preprint arXiv:2405.13185},
  year   = {2024}
}

备注

Accepted at The International Conference on Evaluation and Assessment in Software Engineering (EASE), 2024 edition