中文

Web 应用测试:使用树核在自动化模型推断中检测近重复状态

软件工程 2021-08-31 v1

摘要

在 Web 应用的端到端测试背景下,自动化探索技术(又称爬取)被广泛用于推断被测站点的基于状态的模型。这些模型中,状态表示 Web 应用的特征,转移表示可达关系,可用于若干基于模型的测试任务,如测试用例生成。然而,当前的探索技术常导致模型包含许多近重复状态,即表示略不同页面、实为同一特征实例的状态。这对后续的基于模型的测试任务有负面影响,例如不利地影响生成测试套件的大小、运行时间与达到的覆盖。由于网页可由其树状结构的 DOM 表示自然表示,我们提出一种新颖的近重复检测技术以改进 Web 应用的模型推断,基于树核(TK)函数。TK 是一类计算树状结构对象间相似度的函数,已在自然语言处理领域被大量研究并成功应用。为评估所提方法检测近重复网页的能力,我们在一个约 100k 人工标注网页对的可自由获取大规模数据集上进行了初步分类实验。我们将所提方法的分类性能与其他最先进的近重复检测技术比较。初步结果显示,我们的方法在近重复检测分类任务中优于最先进技术。这些有前景的结果表明 TK 可应用于 Web 应用模型推断背景下的近重复检测,并激励此方向的进一步研究。

关键词

引用

@article{arxiv.2108.13322,
  title  = {Web Application Testing: Using Tree Kernels to Detect Near-duplicate States in Automated Model Inference},
  author = {Anna Corazza and Sergio Di Martino and Adriano Peron and Luigi Libero Lucio Starace},
  journal= {arXiv preprint arXiv:2108.13322},
  year   = {2021}
}

备注

6 pages, 3 figures, accepted for presentation at the 15th ACM/IEEE International Symposium on Empirical Software Engineering and Measurement (ESEM 2021)