中文

利用源代码密度提高提交到维护活动的自动分类准确率

软件工程 2021-05-03 v1 机器学习

摘要

源代码因某种原因而被更改,例如调整、修正或适配。该原因能提供对开发过程的宝贵洞察,但在变更提交到源代码仓库时很少被显式记录。自动提交分类利用从提交中提取的特征来估计该原因。我们引入源代码密度,即提交净规模的度量,并展示相较于先前基于规模的分类,它如何提高自动提交分类的准确率。我们还研究了前序提交世代如何影响一次提交的类,以及考虑先前提交的代码密度是否能进一步提高准确率。对于跨项目提交分类(模型在一个项目上训练并应用于其他项目),我们达到了最高 89% 的准确率与 0.82 的 Kappa。在单个项目上训练的模型产生了最高 93% 的准确率,Kappa 接近 0.90。自动提交分类的准确率对利用该分类的软件(过程)质量分析有直接影响,因此我们对准确率的改进也将提升此类分析的置信度。

关键词

引用

@article{arxiv.2005.13904,
  title  = {Using Source Code Density to Improve the Accuracy of Automatic Commit Classification into Maintenance Activities},
  author = {Sebastian Hönel and Morgan Ericsson and Welf Löwe and Anna Wingkvist},
  journal= {arXiv preprint arXiv:2005.13904},
  year   = {2021}
}

备注

23 pages, to be published in The Journal of Systems and Software