中文

软件项目中代码与非代码问题定位的基准测试

软件工程 2025-10-01 v1 人工智能

摘要

准确的项目定位(例如文件和函数)以解决问题是软件维护中关键的第一步。然而,现有的问题定位基准(如 SWE-Bench 和 LocBench)存在局限性。它们主要关注 pull-request 问题和代码位置,忽略了其他证据以及非代码文件,如提交、注释、配置和文档。为了弥补这一空白,我们引入了 MULocBench,这是一个包含来自 46 个热门 GitHub Python 项目的 1,100 个问题的综合数据集。与现有基准相比,MULocBench 在问题类型、根本原因、定位范围和文件类型方面提供了更大的多样性,为评估提供了更真实的测试平台。使用该基准,我们评估了最先进的定位方法和五种基于 LLM 的提示策略的性能。我们的结果揭示了当前技术的显著局限性:即使在文件级别,性能指标(Acc@5、F1)仍低于 40%。这凸显了将技术泛化到现实的、多方面问题解决的挑战。为了推动针对问题解决的项目定位的未来研究,我们在 https://huggingface.co/datasets/somethingone/MULocBench 公开发布了 MULocBench。

关键词

引用

@article{arxiv.2509.25242,
  title  = {A Benchmark for Localizing Code and Non-Code Issues in Software Projects},
  author = {Zejun Zhang and Jian Wang and Qingyun Yang and Yifan Pan and Yi Tang and Yi Li and Zhenchang Xing and Tian Zhang and Xuandong Li and Guoan Zhang},
  journal= {arXiv preprint arXiv:2509.25242},
  year   = {2025}
}