中文

测试套件有效性度量评估:我们已知什么、又该做什么?

软件工程 2022-04-21 v1

摘要

比较测试套件有效性度量一直是个研究热点。然而,先前研究在比较不同测试套件有效性度量时结论各异甚至相互矛盾。我们发现对学界最困扰的问题是研究者倾向于过度简化其所用真实缺陷的描述。例如,一种常见表述是“我们研究了真实故障与待评估度量(MTE)之间的相关性”。然而,“真实故障”的含义并不明确。因此,有必要审视“真实故障”的含义。否则,所得结论将只是一知半解。为应对该挑战,我们提出框架ASSENT(evAluating teSt Suite EffectiveNess meTrics,评估测试套件有效性度量)以指导后续研究。本质上,ASSENT由三个基本部分组成:真实情况、基准测试套件与一致性指标。首先,具体化真实情况以确定测试套件间有效性的真实排序。其次,生成一组基准测试套件并推导其有效性的真实情况排序。第三,针对基准测试套件,由待评估度量(MTE)生成MTE有效性排序。最后,计算两种排序间的一致性指标。在ASSENT下,我们得以比较不同测试套件有效性度量的准确性。我们应用ASSENT评估代表性测试套件有效性度量,包括变异分数度量与代码覆盖率度量。我们的结果表明,基于真实故障,变异分数与包含性变异分数是量化测试套件有效性的最佳度量。同时,若以变异体替代真实故障,MTE的数值将被高估超过20%。

关键词

引用

@article{arxiv.2204.09165,
  title  = {Test suite effectiveness metric evaluation: what do we know and what should we do?},
  author = {Peng Zhang and Yang Wang and Xutong Liu and Yibiao Yang and Yanhui Li and Lin Chen and Ziyuan Wang and Chang-ai Sun and Yuming Zhou},
  journal= {arXiv preprint arXiv:2204.09165},
  year   = {2022}
}

备注

11 pages