中文

探索小型语言模型在检测手动测试用例中测试味道性能的研究

软件工程 2025-07-18 v1

摘要

手动测试是指测试人员遵循自然语言指令来验证系统行为,这在发现难以被自动化捕获的缺陷方面仍至关重要。然而,这些测试用例常常会受到测试味道的影响,即歧义、冗余或缺失检查等质量问题,这会降低测试的可靠性和可维护性。虽然已有检测工具,但它们通常需要手动定义规则且缺乏可扩展性。本研究探讨了小型语言模型(Small Language Models, SLMs)用于自动检测测试味道的潜力。我们在 143 个真实的 Ubuntu 测试用例上评估了 Gemma3、Llama3.2 和 Phi-4,涵盖七类测试味道。Phi-4 实现了最佳成绩,在检测含有测试味道的句子方面达到了 97% 的通过率(pass@2),而 Gemma3 和 Llama3.2 分别达到约 91%。除了检测外,SLMs 还能自主解释问题并建议改进,即使没有明确的提示指令也能做到。这使它们能够以低成本、概念驱动的方式识别多样化的测试味道,而无需依赖 extensive 规则定义或语法分析。这些发现凸显了 SLMs 作为高效工具的潜力,能够保留数据隐私并在实际场景中提高测试质量。

关键词

引用

@article{arxiv.2507.13035,
  title  = {Investigating the Performance of Small Language Models in Detecting Test Smells in Manual Test Cases},
  author = {Keila Lucas and Rohit Gheyi and Márcio Ribeiro and Fabio Palomba and Luana Martins and Elvys Soares},
  journal= {arXiv preprint arXiv:2507.13035},
  year   = {2025}
}

备注

7 pages, Accepted at Insightful Ideas and Emerging Results (IIER) Track of the Brazilian Symposium on Software Engineering (SBES 2025)