中文

利用时序和语义开发者级信息预测维护活动概况

软件工程 2016-12-01 v1

摘要

传统上,软件项目特性的预测模型基于项目级度量,仅使用很少的开发者级信息,或者根本不使用。在这项工作中,我们提出了新颖的度量,这些度量捕获了按开发者收集的时序和语义开发者级信息。为了解决为大量源代码仓库中的每一位开发者计算这些度量所涉及的可扩展性挑战,我们构建了一个专用的仓库挖掘平台。该平台用于创建一个度量数据集,该数据集基于处理近 1000 个高度流行的开源 GitHub 仓库,包含 1.47 亿行代码,并由 30,000 名开发者维护。然后,计算出的度量被用于预测先前工作中识别的纠正性、完善性和适应性维护活动概况。我们的结果显示出强相关性和有前景的预测能力,R 平方值分别为 0.83、0.64 和 0.75。我们还展示了这些结果如何帮助项目经理检测开发过程中的异常并构建更好的开发团队。此外,我们构建的平台有潜力产生更多利用大规模开发者级度量的预测模型。

关键词

引用

@article{arxiv.1611.10053,
  title  = {Using Temporal and Semantic Developer-Level Information to Predict Maintenance Activity Profiles},
  author = {Stanislav Levin and Amiram Yehudai},
  journal= {arXiv preprint arXiv:1611.10053},
  year   = {2016}
}

备注

Postprint, ICSME 2016 proceedings