中文

SWE-Tester:训练开源大语言模型以复现真实世界仓库中的问题

软件工程 2026-01-21 v1 机器学习

摘要

软件测试对于确保软件系统的正确性和可靠性至关重要。从自然语言问题描述中自动生成问题复现测试,通过简化根本原因分析来提高开发者生产力,促进测试驱动开发——“先测试,后写代码”,并可用于提高自动化问题解决系统(如编码智能体)的有效性。为此任务提出的现有方法主要依赖闭源LLM,对开源模型的探索有限。为解决这一问题,我们提出了SWE-Tester——一个用于训练开源LLM生成问题复现测试的新颖流程。首先,我们从2.6K个开源GitHub仓库中精心整理了一个包含41K个实例的高质量训练数据集,并用它来训练不同规模和家族的LLM。微调后的模型在SWT-Bench Verified上的成功率和变更覆盖率分别实现了高达10%和21%的绝对提升。进一步分析表明,随着推理时计算量、数据量和模型规模的增加,性能持续提升。这些结果凸显了我们框架在推动该领域开源LLM发展方面的有效性。

关键词

引用

@article{arxiv.2601.13713,
  title  = {SWE-Tester: Training Open-Source LLMs for Issue Reproduction in Real-World Repositories},
  author = {Aditya Bharat Soni and Rajat Ghosh and Vaishnavi Bhargava and Valerie Chen and Debojyoti Dutta},
  journal= {arXiv preprint arXiv:2601.13713},
  year   = {2026}
}