中文

MultiFileTest:一个多文件级别的LLM单元测试生成基准及错误修复机制的影响

软件工程 2026-04-08 v5 计算与语言

摘要

单元测试生成已成为一种有前景且重要的大型语言模型(LLM)应用。然而,现有的LLM单元测试生成评估基准 focus on function-或 class-level code(单文件),而非更实用且具有挑战性的 multi-file-level codebases。为此,我们提出 MultiFileTest,一个用于单元测试生成的多文件级别基准,覆盖 Python、Java 和 JavaScript。MultiFileTest 每种语言包含20个中等规模和高质量的项目。我们在MultiFileTest上评估了eleven frontier LLMs,结果显示大多数前沿 LLM 在 MultiFileTest 上表现中等,这突显了 MultiFileTest 的难度。我们还进行了 thorough error analysis,发现即使是像 Gemini-3.0-Pro 这类高级 LLM,也 exhibit basic yet critical errors,包括 executability 和 cascade errors。我们激发此观察后,进一步评估了所有前沿 LLM 在 manual error-fixing 和 self-error-fixing scenarios 下的表现,以评估其在配备 error-fixing mechanisms 时的潜力。我们的 code 和 dataset is available at \href{https://github.com/YiboWANG214/ProjectTest}{MultiFileTest}。

关键词

引用

@article{arxiv.2502.06556,
  title  = {MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms},
  author = {Yibo Wang and Congying Xia and Wenting Zhao and Jiangshu Du and Chunyu Miao and Zhongfen Deng and Philip S. Yu and Chen Xing},
  journal= {arXiv preprint arXiv:2502.06556},
  year   = {2026}
}

备注

Published at ACL 2026 (Findings)