中文

基于历史感知规划的任务描述测试用例生成

软件工程 2025-09-12 v2

摘要

在自动化web测试中,从自然语言任务描述生成测试脚本对于提高测试生成过程至关重要。这一活动涉及创建正确的动作序列以形成用于未来测试活动的测试脚本。当前最先进的方法在生成这些动作序列方面受限,要么需要大量的人类演示手动工作,要么未能考虑以前的web内容和动作历史以决定下一个动作。在本文中,我们引入了HxAgent,这是一种迭代式大型语言模型代理规划方法,基于:1)当前内容和可行动作的观察,2)之前web状态和动作的短期记忆,以及3)以往(不)正确动作序列的长期经验来确定下一个动作。该代理生成一系列动作来完成给定任务,这实际上是一个自动化测试用例,用于验证该任务。我们对HxAgent进行了广泛的实证评估,使用两个数据集。在MiniWoB++数据集上,我们的方法实现了97%的精确匹配准确率,这相当于最佳基线水平,同时消除了需要人类演示的需求。对于需要通过多个动作和屏幕导航的复杂任务,HxAgent实现了平均82%的精确匹配。在第二个数据集中,包含7个流行网站(包括YouTube、LinkedIn、Facebook和Google)的350个任务实例,HxAgent实现了高性能,87%的动作序列与真实情况完全匹配,前缀匹配率达93%,超过基线59%。

关键词

引用

@article{arxiv.2504.14336,
  title  = {Toward Generation of Test Cases from Task Descriptions via History-aware Planning},
  author = {Duy Cao and Phu Nguyen and Vy Le and Tien N. Nguyen and Vu Nguyen},
  journal= {arXiv preprint arXiv:2504.14336},
  year   = {2025}
}

备注

Change the method and experimentation