评估大语言模型在基于等价类和边界值生成单元测试中的应用
软件工程
2025-05-16 v1 人工智能
摘要
单元测试的设计与实现是一项许多程序员忽视的复杂任务。本研究评估了大语言模型(LLMs)在自动生成测试用例方面的潜力,并将其与手动测试进行了比较。我们开发了一种优化的提示,将代码与需求相结合,涵盖了等价类和边界值等关键用例。通过定量指标和手动定性分析,比较了大语言模型与训练有素的程序员的优势与劣势。结果表明,大语言模型的有效性依赖于精心设计的提示、稳健的实现和精确的需求。尽管灵活且前景广阔,大语言模型仍然需要人工监督。本工作强调了手动定性分析作为自动化单元测试评估中不可或缺的补充手段的重要性。
引用
@article{arxiv.2505.09830,
title = {Evaluating Large Language Models for the Generation of Unit Tests with Equivalence Partitions and Boundary Values},
author = {Martín Rodríguez and Gustavo Rossi and Alejandro Fernandez},
journal= {arXiv preprint arXiv:2505.09830},
year = {2025}
}
备注
Under revision at Jornadas de Cloud Computing, Big Data & Emerging Topics (JCC-BD&ET) - 2025