中文

PTMTorrent:用于挖掘开源预训练模型包的数据集

软件工程 2023-03-17 v1

摘要

由于从头开发和训练深度学习模型成本高昂,机器学习工程师已开始复用预训练模型(PTMs)并对其进行微调以用于下游任务。被称为“模型中心”的 PTM 注册库支持工程师分发和复用深度学习模型。PTM 包包括预训练权重、文档、模型架构、数据集和元数据。挖掘 PTM 包中的信息将能够发现工程现象并支持软件工程师的工具。然而,访问这些信息很困难——存在许多 PTM 注册库,且注册库和单个包都可能对数据访问进行速率限制。我们提出一个开源数据集 PTMTorrent,以促进对 PTM 包的评估和理解。本文描述了该数据集的创建、结构、使用和局限性。该数据集包含 5 个模型中心的快照以及总共 15,913 个 PTM 包。这些包以统一的数据模式表示,以支持跨中心挖掘。我们描述了该数据的先前用途,并提出了使用我们的数据集进行挖掘的研究机会。PTMTorrent 数据集(v1)可在以下地址获取:https://app.globus.org/file-manager?origin_id=55e17a6e-9d8f-11ed-a2a2-8383522b48d9&origin_path=%2F~%2F. 我们的数据集生成工具可在 GitHub 上获取:https://doi.org/10.5281/zenodo.7570357。

关键词

引用

@article{arxiv.2303.08934,
  title  = {PTMTorrent: A Dataset for Mining Open-source Pre-trained Model Packages},
  author = {Wenxin Jiang and Nicholas Synovic and Purvish Jajal and Taylor R. Schorlemmer and Arav Tewari and Bhavesh Pareek and George K. Thiruvathukal and James C. Davis},
  journal= {arXiv preprint arXiv:2303.08934},
  year   = {2023}
}

备注

5 pages, 2 figures, Accepted to MSR'23