大型语言模型生成的Python测试的质量评估
软件工程
2025-06-18 v1
摘要
手动生成测试脚本是一个耗时、昂贵且容易出错的过程,这表明了自动化解决方案的价值。大型语言模型在这一领域显示出巨大潜力,它们利用广泛的知识更高效地生成测试代码。本研究调查了由三个大型语言模型生成的Python测试代码的质量:GPT-4o、Amazon Q和LLama 3.3。我们评估了在两种不同的提示上下文下生成的测试套件的结构可靠性:Text2Code和Code2Code。我们的分析包括识别错误和测试坏味,重点关注这些问题与不充分设计模式的相关性。我们的研究结果显示,大多数由大型语言模型生成的测试套件至少包含一个错误或测试坏味。断言错误最为常见,占所有识别错误的64%,而测试坏味“测试用例缺乏内聚性”是最常检测到的(41%)。提示上下文显著影响测试质量;带有详细指令的文本提示通常产生的测试错误较少,但测试坏味的发生率更高。在评估的大型语言模型中,GPT-4o在两种上下文中产生的错误最少(C2C中为10%,T2C中为6%),而Amazon Q的错误率最高(C2C中为19%,T2C中为28%)。对于测试坏味,Amazon Q在C2C上下文中的检测较少(9%),而LLama 3.3在T2C上下文中表现最佳(10%)。此外,我们观察到特定错误(如断言或缩进问题)与测试用例内聚性坏味之间存在强相关性。这些发现展示了通过大型语言模型提高测试生成质量的机会,并强调了未来研究需要探索优化生成场景和更好的提示工程策略。
引用
@article{arxiv.2506.14297,
title = {Quality Assessment of Python Tests Generated by Large Language Models},
author = {Victor Alves and Carla Bezerra and Ivan Machado and Larissa Rocha and Tássio Virgínio and Publio Silva},
journal= {arXiv preprint arXiv:2506.14297},
year = {2025}
}
备注
International Conference on Evaluation and Assessment in Software Engineering (EASE), 2025 edition