LLM能否为算法问题生成高质量测试用例?TestCase-Eval:故障覆盖与暴露的系统性评估
软件工程
2025-06-17 v1 计算与语言
摘要
我们提出了TestCase-Eval,这是一个用于系统评估LLM在测试用例生成方面表现的新基准。TestCase-Eval包含来自Codeforces平台的500个算法问题和100,000个人工编写的解法。它聚焦于两个关键任务:(1) 故障覆盖,用于衡量LLM生成的测试集在探测多样化输入场景和覆盖广泛潜在故障模式方面的能力。(2) 故障暴露,用于评估LLM能否设计出能够揭示特定错误代码实现的定制化测试输入。我们对19种最先进的开源和专有LLM在TestCase-Eval上进行了全面评估,揭示了它们在生成有效测试用例方面的优势与局限。
引用
@article{arxiv.2506.12278,
title = {Can LLMs Generate High-Quality Test Cases for Algorithm Problems? TestCase-Eval: A Systematic Evaluation of Fault Coverage and Exposure},
author = {Zheyuan Yang and Zexi Kuang and Xue Xia and Yilun Zhao},
journal= {arXiv preprint arXiv:2506.12278},
year = {2025}
}
备注
ACL 2025