中文

单一补丁并不足够:修复候选的确定性融合

软件工程 2026-07-02 v1

摘要

现代LLM编码代理通常使用pass@k进行评估,但在实际应用中,开发者通常只应用一个最终补丁。这种pass@k到pass@1的差距是一个生成后问题:候选补丁池可能包含正确的补丁,但系统必须决定向开发者推荐哪一个。现有的生成后方法主要对整体候选进行排序、用测试进行过滤,或查询LLM评判器,但都没有确定性地重用共享的编辑原子证据来选择和构建最终补丁。因此,我们提出了PatchFusion,一种用于候选补丁的确定性原子证据融合方法,它在决策时不参考任何测试结果。PatchFusion首先将整体差异一致性融合到修复邻域中,选择一个可审计的代表,然后应用证据约束融合(ECF)来保留重复的编辑原子并修剪不支持的部分。为了评估这一设置,我们构建了PatchFuseBench,一个涵盖SWE-bench Verified、SWE-bench Multilingual和Defects4J候选补丁的固定池基准。在PatchFuseBench上,PatchFusion在SWE-bench Verified上解决了426/500个错误,在SWE-bench Multilingual上解决了236/300个错误,并在Defects4J上达到了87/371个合理补丁,在所有三个基准上均优于所有匹配的候选池选择器。PatchFusion恢复了41个和27个没有任何单一来源能解决的错误(比最佳单一来源多30个和18个)。消融研究表明,ECF通过恢复选择遗漏的池内修复,额外解决了+5/+6/+9个错误,且未观察到性能下降,并且PatchFusion的增益在候选池重新采样时保持稳定。在这些互补的多源池上,跨候选证据比我们评估的基于测试和基于LLM的选择器恢复了更多正确的补丁,成本低数个数量级,在两个SWE-bench基准上分别达到了候选可达上限的96.2%和89.7%。

关键词

引用

@article{arxiv.2607.01597,
  title  = {A Single Patch Is Not Enough: Deterministic Fusion of Repair Candidates},
  author = {Boyang Yang and Xiangliang Hu and Luyao Ren and Yanjun Chen and Bach Le and Tegawendé F. Bissyandé and Haoye Tian},
  journal= {arXiv preprint arXiv:2607.01597},
  year   = {2026}
}