具有多样性的移动应用测试套件生成的综合实证评估
软件工程
2020-12-29 v1
摘要
背景:在基于搜索的软件工程中,我们通常使用带有默认配置的流行启发式算法,这往往导致次优结果;或者我们通过试错实验来确定配置,这可能为特定问题带来更好的结果。我们考虑了为移动应用程序生成测试套件的问题,并依赖于 Sapienz——一种使用流行启发式算法 (NSGA-II) 及默认配置的该问题最先进方法。目标:我们希望在生成测试套件时通过 Sapienz 取得更好的结果,同时避免通过试错实验来确定 Sapienz 的更合适配置。方法:我们对 Sapienz 进行了适应度景观分析,以解析地理解该搜索问题,这使我们能够在开发 SapienzDiv 时对 Sapienz 的启发式算法和配置做出明智的决策。我们在 34 个应用程序上以直接对比的方式全面评估了 SapienzDiv 与 Sapienz。结果:分析 Sapienz 的适应度景观后,我们观察到演化出的测试套件缺乏多样性,且搜索在 25 代后出现停滞。SapienzDiv 实现了保持演化中测试套件多样性的机制。评估表明,在覆盖率和揭示的故障数量方面,SapienzDiv 取得了优于或至少类似于 Sapienz 的测试结果。然而,SapienzDiv 通常会产生更长的测试序列,并且需要比 Sapienz 更多的执行时间。结论:通过适应度景观分析获得的对搜索问题的理解,帮助我们在没有试错实验的情况下找到了 Sapienz 的更合适配置。通过在搜索过程中促进测试套件的多样性,可以在故障和覆盖率方面实现改进或至少相似的测试结果。
引用
@article{arxiv.2012.14237,
title = {A Comprehensive Empirical Evaluation of Generating Test Suites for Mobile Applications with Diversity},
author = {Thomas Vogel and Chinh Tran and Lars Grunske},
journal= {arXiv preprint arXiv:2012.14237},
year = {2020}
}
备注
Accepted Manuscript. arXiv admin note: text overlap with arXiv:1906.08142