论_fault localization_context 在 LLM-based 程序修复中的作用
软件工程
2026-04-08 v1 人工智能
摘要
Fault Localization(故障定位)是 Large Language Model(大语言模型)驱动的自动化程序修复(APR)的关键组件,但其影响仍未得到充分探讨。特别是,人们尚不清楚需要多少定位信息、额外的上下文信息(超出预测的错误位置)是否有益,以及应如何检索此类上下文。我们对 500 个 SWE-bench Verified 实例使用 GPT-5-mini 进行大规模实证研究,评估了 61 种配置,这些配置在文件级、元素级和行级上下文方面有所不同。我们的结果表明,更多的上下文并不一定会改善修复性能。文件级定位是关键因素,相较于无文件基线可实现 15-17 倍的提升。扩展文件上下文往往与更好的性能相关,成功修复最常见于包含约 6-10 个相关文件的文件配置中。元素级上下文扩展提供的收益取决于文件上下文质量,而行级上下文扩展常常因噪声放大而导致性能下降。LLM-based 检索通常在使用更少文件和标记数的前提下优于结构启发式方法。总体而言,最有效的故障定位上下文策略通常是在更高抽象层次上获得广泛语义理解,同时结合精确的行级定位。这些发现挑战了我们假设“增加定位上下文会普遍提升 APR 性能”的观念,并为设计 LLM-based 故障定位策略提供了实用指导。
引用
@article{arxiv.2604.05481,
title = {On the Role of Fault Localization Context for LLM-Based Program Repair},
author = {Melika Sepidband and Hung Viet Pham and Hadi Hemmati},
journal= {arXiv preprint arXiv:2604.05481},
year = {2026}
}
备注
30 pages, 8 figures