中文

使用大型语言模型自动生成高级测试用例

软件工程 2025-03-25 v1

摘要

我们探讨了实践者在软件测试中面临的挑战,并提出了自动化解决方案。我们对当地软件公司和 26 名实践者进行了调查,发现主要挑战并非编写测试脚本,而是与业务要求保持一致。基于这些见解,我们构建了一个从用例到(高级)测试用例的数据集,用于训练/微调模型以生成高级测试用例。高级测试用例指定需要测试软件功能的方面,以及预期结果。我们评估了大型语言模型,如 GPT-4o、Gemini、LLaMA 3.1 8B 和 Mistral 7B,其中后两种模型的微调可提升性能。最终的人类评估调查确认了这些生成测试用例的有效性。我们的主动方法加强了需求-测试对齐,促进了开发早期的测试用例生成。

关键词

引用

@article{arxiv.2503.17998,
  title  = {Automatic High-Level Test Case Generation using Large Language Models},
  author = {Navid Bin Hasan and Md. Ashraful Islam and Junaed Younus Khan and Sanjida Senjik and Anindya Iqbal},
  journal= {arXiv preprint arXiv:2503.17998},
  year   = {2025}
}

备注

Accepted at International Conference on Mining Software Repositories (MSR) 2025