中文

用于测试骨架生成的大型语言模型比较评估

软件工程 2025-09-08 v1

摘要

本文探讨了使用大型语言模型 (LLM) 自动生成测试骨架——即概述单元测试覆盖范围而不实现完整测试逻辑的结构模板。测试骨架在测试驱动开发 (TDD) 中尤为重要,它们为系统性验证提供了早期框架。传统上由人工编写,其创建过程可能耗时且容易出错,特别是在教育或大规模开发环境中。我们评估了四个 LLM——GPT-4、DeepSeek-Chat、Llama4-Maverick 和 Gemma2-9B——为大学软件工程课程中开发的真实 Ruby 类生成 RSpec 骨架的能力。每个模型的输出均通过静态分析和盲法专家评审进行评估,以衡量结构正确性、清晰度、可维护性以及对测试最佳实践的符合度。该研究揭示了模型在解释代码结构和测试约定方面的关键差异,为使用 LLM 进行自动化测试脚手架生成的实际挑战提供了见解。我们的结果表明,DeepSeek 生成了最可维护且结构良好的骨架,而 GPT-4 生成了更完整但约定不一致的输出。研究揭示了提示设计和上下文输入是关键的质量因素。

关键词

引用

@article{arxiv.2509.04644,
  title  = {Comparative Evaluation of Large Language Models for Test-Skeleton Generation},
  author = {Subhang Boorlagadda and Nitya Naga Sai Atluri and Muhammet Mustafa Olmez and Edward F. Gehringer},
  journal= {arXiv preprint arXiv:2509.04644},
  year   = {2025}
}

备注

Forthcoming in Frontiers in Education (FIE 2025), Nashville, Tennessee, USA, Nov 2-5, 2025