中文

大规模、独立且全面的 LLM 用于测试用例生成能力研究

软件工程 2026-03-05 v4

摘要

单元测试是软件可靠性的关键,但手动创建测试用例耗时且常被忽视。基于搜索的软件测试提高了效率,但产生的测试具有较差的可读性和可维护性,而 LLM 显示出的潜力却缺乏对基于推理的提示和真实场景的全面评估。本研究对 LLM 生成的单元测试进行首次大规模实证评估,完整覆盖类层面,分析四种模型(GPT-3.5、GPT-4、Mistral 7B 和 Mixtral 8x7B)相对于 EvoSuite 的表现,目标为 216,300 个测试用例,涵盖 Defects4J、SF110 和 CMD。我们评估了五种提示技术(ZSL、FSL、CoT、ToT 和 GToT),评估指标包括可编译性、幻觉导致的错误、可读性、覆盖率和测试异味。基于推理的提示技术,特别是 GToT,显著提升了可靠性和可编译性,但幻觉导致的错误仍然普遍,编译失败率可达 86%。尽管 LLM 生成的测试通常比基于搜索的测试更具可读性,但魔法数字测试和断言赌博等持续问题阻碍了可维护性。这些发现表明,结合 LLM 生成与自动化验证和基于搜索的细化的混合方法对于实现生产就绪结果至关重要。

关键词

引用

@article{arxiv.2407.00225,
  title  = {Large-scale, Independent and Comprehensive study of the power of LLMs for test case generation},
  author = {Wendkûuni C. Ouédraogo and Kader Kaboré and Yinghua Li and Haoye Tian and Anil Koyuncu and Jacques Klein and David Lo and Tegawendé F. Bissyandé},
  journal= {arXiv preprint arXiv:2407.00225},
  year   = {2026}
}

备注

Accepted at Empirical Software Engineering (EMSE) journal on 3 March 2026