中文

大语言模型在行为驱动开发验收测试自动化中的应用:综合评估与见解

软件工程 2024-05-13 v1 人工智能

摘要

行为驱动开发 (Behavior-driven development, BDD) 是一种促进开发人员、QA 分析师与利益相关者之间协作的敏捷测试方法。在本文中,我们提出了一种利用大语言模型 (Large Language Models, LLMs) 自动生成验收测试以增强 BDD 实践的新方法。我们的研究使用零样本与少样本提示来评估 GPT-3.5、GPT-4、Llama-2-13B 和 PaLM-2 等 LLMs。本文详细介绍了包含数据集、提示技术、LLMs 和评估过程的方法论。结果表明,GPT-3.5 和 GPT-4 生成了无误的 BDD 验收测试,且性能更佳。少样本提示技术凸显了其通过为上下文学习提供示例来获得更高准确性的能力。此外,本研究考察了语法错误、验证准确率以及 LLMs 的对比分析,揭示了它们在增强 BDD 实践方面的有效性。然而,本研究也承认所提方法存在局限性。我们强调,该方法可支持协作式 BDD 流程,并为未来利用 LLMs 自动生成 BDD 验收测试的研究创造机会。

关键词

引用

@article{arxiv.2403.14965,
  title  = {Comprehensive Evaluation and Insights into the Use of Large Language Models in the Automation of Behavior-Driven Development Acceptance Test Formulation},
  author = {Shanthi Karpurapu and Sravanthy Myneni and Unnati Nettur and Likhit Sagar Gajja and Dave Burke and Tom Stiehm and Jeffery Payne},
  journal= {arXiv preprint arXiv:2403.14965},
  year   = {2024}
}