开源数据科学项目中编码标准符合度的大规模比较分析
软件工程
2020-07-29 v2
摘要
背景:满足业界日益增长的数据科学需求,需要能够将机器学习研究转化为生产就绪代码的跨学科技团队。软件工程团队重视对编码标准的遵守,将其视为代码可读性、可维护性和开发者专业水平的标志。然而,目前尚无专门针对数据科学项目编码标准的大规模实证研究。目的:本研究调查数据科学项目遵循代码标准的程度。具体而言,哪些标准被遵守、哪些被忽视,以及这与传统软件项目有何不同?方法:我们将一个包含1048个开源数据科学项目的语料库与一组1099个具有相似质量与成熟度的非数据科学参考项目进行比较。结果:数据科学项目中存在显著更高比例的使用过多参数和局部变量的函数。数据科学项目还遵循与非数据科学项目不同的变量命名约定。结论:这些差异表明数据科学代码库不同于传统软件代码库,且不遵循传统软件工程惯例。我们推测,这可能是因为传统软件工程惯例在数据科学项目背景下并不适用。
引用
@article{arxiv.2007.08978,
title = {A large-scale comparative analysis of Coding Standard conformance in Open-Source Data Science projects},
author = {Andrew J. Simmons and Scott Barnett and Jessica Rivera-Villicana and Akshat Bajaj and Rajesh Vasa},
journal= {arXiv preprint arXiv:2007.08978},
year = {2020}
}
备注
11 pages, 7 figures. To appear in ESEM 2020. Updated based on peer review