中文

我们能否对代码评审研究进行基准测试?关于方法、数据集与指标的系统映射研究

软件工程 2021-04-14 v2

摘要

代码评审(CR)是软件质量保障的基石,也是软件开发的关键实践。随着 CR 研究的成熟,追踪方法、数据集和指标方面的最佳实践与前沿进展变得困难。本文通过收集 CR 研究的方法、数据集和指标来探讨基准测试的潜力。我们进行了一项系统映射研究。从 2011 至 2019 年发表于高影响力场所的 19,847 篇论文中筛选出共计 112 篇研究并进行分析。首先,我们发现经验评估是最常用的方法(占论文的 65%),而解决方案与经验型方法是最不常用的方法。其次,我们强调使用定量方法或混合方法的论文中有 50% 具有可复现潜力。第三,我们识别出 457 个指标,将其归为十六个核心指标集,应用于九个软件工程主题,显示不同研究主题倾向于使用特定指标集。我们得出结论:现阶段尚无法对 CR 研究进行基准测试。尽管如此,一个通用基准将便利新研究者(包括其他领域的专家)创新新技术并基于已有确立的方法论进行构建。完整复现见 https://naist-se.github.io/code-review/。

关键词

引用

@article{arxiv.1911.08816,
  title  = {Can We Benchmark Code Review Studies? A Systematic Mapping Study of Methodology, Dataset, and Metric},
  author = {Dong Wang and Yuki Ueda and Raula Gaikovina Kula and Takashi Ishio and Kenichi Matsumoto},
  journal= {arXiv preprint arXiv:1911.08816},
  year   = {2021}
}