软件仓库如何被挖掘?关于工作流、方法论、可复现性与工具的系统文献综述
软件工程
2022-04-19 v1
摘要
随着开源软件的出现,此前专有的软件开发数据宝库得以公开。这为学术界任何人开启了实证软件工程研究的领域。然而,从软件项目中挖掘的数据需要大量处理,且须极为谨慎地对待,以确保结论有效。由于软件开发实践与工具在二十年间已发生变化,我们旨在理解最前沿的研究工作流并凸显潜在挑战。我们采用系统文献综述,从顶级会议中抽样逾千篇论文,并从数据工作流、方法论、可复现性与工具的角度分析其中 286 篇最相关论文。我们发现研究工作流中涉及数据集选择的重要部分尤其存在问题,这对现有文献结果的普适性提出了质疑。此外,我们发现相当数量的论文极少或完全未提供可复现性说明——对数据密集型领域而言是重大缺陷。事实上,33% 的论文未提供其数据如何获取的信息。基于这些发现,我们提出了通过现有工具解决这些不足的途径,并给出改进研究工作流与研究可复现性的建议。
引用
@article{arxiv.2204.08108,
title = {How are Software Repositories Mined? A Systematic Literature Review of Workflows, Methodologies, Reproducibility, and Tools},
author = {Adam Tutko and Austin Z. Henley and Audris Mockus},
journal= {arXiv preprint arXiv:2204.08108},
year = {2022}
}
备注
11 Pages