中文

大型语言模型作为测试用例生成器:性能评估与增强

软件工程 2024-04-23 v1 人工智能

摘要

大型语言模型 (LLM)的代码生成研究已广泛进行并取得显著进展。作为代码生成的互补方面,测试用例生成对于确保代码质量和可靠性至关重要。然而,LLM 作为测试用例生成器的研究 severely 受限于探索。当前研究主要聚焦于利用 LLM 生成的测试用例来增强代码生成,而 LLM 在独立测试用例生成方面的性能尚未全面评估。为填补这一差距,我们进行大量实验,研究 LLM 能否生成高质量测试用例。我们发现,随着问题难度的增加,最先进的 LLM 在生成正确测试用例方面受到挑战,主要源于其在计算和推理上的固有局限。为缓解此问题,我们进一步提出一种称为 TestChain 的多智能体框架,将测试输入和输出的生成解耦。值得注意的是,TestChain 使用 ReAct 格式的对话链,使 LLM 能够与 Python 解释器交互,以提供更准确的测试输出。我们的结果表明,TestChain 在基线方法上显著优于后者。特别是就测试用例的准确率而言,TestChain 采用 GPT-4 作为底层模型,在 LeetCode-hard 数据集上实现了 13.84% 的提升。

关键词

引用

@article{arxiv.2404.13340,
  title  = {Large Language Models as Test Case Generators: Performance Evaluation and Enhancement},
  author = {Kefan Li and Yuan Yuan},
  journal= {arXiv preprint arXiv:2404.13340},
  year   = {2024}
}