LoRA 微调大语言模型用于自动生成测试用例的实证研究
软件工程
2026-04-09 v1 人工智能
摘要
从自然语言需求自动生成测试用例仍然是软件工程中的一个具有挑战性的问题,因为需求存在歧义,且需要生成结构化的、可执行的测试产物。近年来,大语言模型(LLM)在解决这一任务方面展现出前景;然而,其有效性取决于任务特定的适配和高效的微调策略。在本文中,我们对参数高效微调——特别是 LoRA——在基于需求的测试用例生成中的应用进行了全面的实证研究。我们在统一的实验框架下评估了多个大语言模型家族,包括开源和专有模型。该研究系统地探讨了 LoRA 关键超参数——包括秩(rank)、缩放因子(scaling factor)和 dropout——对下游性能的影响。我们提出了一个基于 GPT-4o 的自动评估框架,该框架从九个质量维度评估生成的测试用例。实验结果表明,基于 LoRA 的微调显著提升了所有开源模型的性能,其中 Ministral-8B 取得了最佳结果。此外,我们证明经过微调的 8B 开源模型可以达到与预微调 GPT-4.1 模型相当的性能,这凸显了参数高效适配的有效性。虽然 GPT-4.1 模型取得了最高的整体性能,但在微调之后,专有模型与开源模型之间的性能差距大幅缩小。这些发现为模型选择、微调策略和自动测试评估方法提供了重要见解。特别是,它们表明经过良好设计的微调方法后,成本高效、可本地部署的开源模型可以作为专有系统的可行替代方案。
引用
@article{arxiv.2604.06946,
title = {An empirical study of LoRA-based fine-tuning of large language models for automated test case generation},
author = {Milad Moradi and Ke Yan and David Colwell and Rhona Asgari},
journal= {arXiv preprint arXiv:2604.06946},
year = {2026}
}