中文

开源机器学习包仓库中软件工程实践的实证研究

软件工程 2020-12-09 v2 人工智能

摘要

人工智能(AI)特别是机器学习(ML)的最新进展,引入了各种实际应用(例如虚拟个人助理和自动驾驶汽车),提升了日常用户的体验。然而,深度学习等现代 ML 技术需要相当的技术专长和资源来开发、训练和部署此类模型,使得 ML 模型的有效复用成为必要。从业者和研究者的此类发现与复用正由公共 ML 包仓库解决,这些仓库将预训练模型打包为包进行发布。由于此类仓库是近期现象,目前尚无关于其现状与挑战的经验数据。因此,本文开展了一项探索性研究,分析两个流行 ML 包仓库 TFHub 和 PyTorch Hub 的结构与内容,将其信息元素(特性与策略)、包组织、包管理器功能及使用上下文与流行软件包仓库(npm、PyPI 和 CRAN)进行比较。通过这些研究,我们识别了共享 ML 包的独特 SE 实践与挑战。这些发现与启示对打算使用这些共享 ML 包的数据科学家、研究者和软件开发者将是有用的。

关键词

引用

@article{arxiv.2012.01403,
  title  = {Empirical Study on the Software Engineering Practices in Open Source ML Package Repositories},
  author = {Minke Xiu and Ellis E. Eghan and Zhen Ming and Jiang and Bram Adams},
  journal= {arXiv preprint arXiv:2012.01403},
  year   = {2020}
}