中文

SPICE:面向问题清晰度、测试覆盖度与工作量估计的自动化 SWE-Bench 标注管道

软件工程 2025-09-19 v5 人工智能

摘要

高质量的标注数据集对训练和评估软件工程中的基础模型至关重要,但创建过程往往昂贵且费时。我们介绍了 SPICE,这是一个可扩展的、用于标注类似 SWE-bench 的数据集的自动化管道,标注包括问题清晰度、测试覆盖度和工作量估计。SPICE 结合了情境感知的代码导航、理性驱动的提示和多轮共识,产生的标注与专家标注高度一致。SPICE 的设计受到了我们对超过 800 个实例进行标注经验和挫败感的启发。SPICE 实现了与人工标注 SWE-bench Verified 数据高度一致的结果,同时将标注 1000 个实例的成本从约 10 万美元(人工标注)降至仅 5.10 美元。这些结果表明 SPICE 有潜力实现面向软件工程基础模型的成本效益高的大规模数据集创建。为支持社区,我们发布了 SPICE 工具和 SPICE Bench 数据集,来自 291 个开源项目的 6802 个 SPICE 标注实例(规模是 SWE-bench Verified 的 13 倍以上)。

关键词

引用

@article{arxiv.2507.09108,
  title  = {SPICE: An Automated SWE-Bench Labeling Pipeline for Issue Clarity, Test Coverage, and Effort Estimation},
  author = {Gustavo A. Oliva and Gopi Krishnan Rajbahadur and Aaditya Bhatia and Haoxiang Zhang and Yihao Chen and Zhilong Chen and Arthur Leung and Dayi Lin and Boyuan Chen and Ahmed E. Hassan},
  journal= {arXiv preprint arXiv:2507.09108},
  year   = {2025}
}

备注

*First three authors contributed equally