面向存储库级错误定位的图神经网络基准——GREPO
机器学习
2026-02-17 v1 人工智能
软件工程
摘要
存储库级错误定位——即识别必须修改代码以修复错误的地方——是软件工程中的关键挑战。标准的大语言模型(LLM)由于无法处理整个代码存储库的上下文窗口限制而常不适用于此任务。因此,常用各种检索方法,包括关键词匹配、文本相似性以及简单图基 heuristics 如广度优先搜索。图神经网络(GNN)提供了一种具有竞争力的替代方案,因其能够建模复杂的存储库范围依赖关系;然而,其应用受限于缺乏专门的基准。为填补这一空白,我们引入GREPO——首个针对存储库规模错误定位任务的GNN基准。GREPO包含86个Python存储库和47294个修复错误的任务,提供可直接供GNN处理的图基数据结构。我们对 various GNN architectures进行评估,表现优于 established information retrieval baselines。这一工作凸显了GNN用于错误定位的潜力,并将GREPO established 为 future research的基础资源。代码可在 https://github.com/qingpingmo/GREPO 获取。
引用
@article{arxiv.2602.13921,
title = {GREPO: A Benchmark for Graph Neural Networks on Repository-Level Bug Localization},
author = {Juntong Wang and Libin Chen and Xiyuan Wang and Shijia Kang and Haotong Yang and Da Zheng and Muhan Zhang},
journal= {arXiv preprint arXiv:2602.13921},
year = {2026}
}
备注
46 pages, 14figures