使用检索增强 LLM 从自然语言需求生成测试场景:一项工业研究
软件工程
2025-01-14 v1
摘要
测试场景是测试用例的特定实例,描述了用于验证特定软件功能的操作。通过概述软件运行的条件和预期结果,测试场景确保软件功能以集成的方式进行测试。测试场景对于在各种条件下(包括边缘情况)系统地测试应用程序、识别潜在问题并保证整体性能和可靠性至关重要。编写测试场景十分繁琐,需要对软件功能和底层领域有深刻的理解。这进一步对原本时间和预算受限的需求工程师和测试团队提出了巨大的努力和投资要求。本文提出了一种使用检索增强生成(Retrieval-Augmented Generation, RAG)与大型语言模型(Large Language Models, LLMs)的测试场景生成自动化方法(RAGTAG)。RAG 允许将特定领域知识与 LLM 的生成能力相集成。我们在来自奥地利邮政的两个工业项目上评估了 RAGTAG,这些项目具有德语和英语的双语需求。我们对四名专家进行的访谈调查结果从五个维度——相关性、覆盖率、正确性、连贯性和可行性——肯定了 RAGTAG 在自动化测试场景生成方面的潜力。具体而言,我们的结果表明,尽管分析双语需求是一项困难的任务,但 RAGTAG 能够生成与底层需求良好对齐的场景,并覆盖预期功能的不同方面。生成的场景易于专家理解,并在项目环境中可行。整体正确性被认为是令人满意的;然而,在捕捉精确操作序列和领域细微差别方面仍存在差距,这凸显了在应用 LLM 时对领域专业知识的需求。
引用
@article{arxiv.2404.12772,
title = {Generating Test Scenarios from NL Requirements using Retrieval-Augmented LLMs: An Industrial Study},
author = {Chetan Arora and Tomas Herda and Verena Homm},
journal= {arXiv preprint arXiv:2404.12772},
year = {2025}
}