中文

自动化 bug 修复中长程上下文推理的极限

软件工程 2026-03-09 v2 机器学习

摘要

不断增长的上下文长度导致人们假设大型语言模型(LLM)能够直接推理整个代码库。同时,近期 LLM 的进步使得配合智能体工作流程在软件工程基准测试中取得强大的性能。本文系统评估了当前 LLM 是否能够可靠地执行长程上下文代码调试和补丁生成。我们以 SWE-bench Verified 作为受控实验环境,首先在智能体套件(mini-SWE-agent)中评估最先进的模型,其中性能得到显著提升:GPT-5-nano 在 100 个样本上实现最高可达 31% 的解决率,开源模型如 Deepseek-R1-0528 也取得具竞争力的结果。然而,token 级别的分析显示,成功的智能体轨迹通常保持在 2 万-3 万 token 之间,更长的累积上下文与更低的成功率相关,表明智能体成功主要源于将任务分解为短程上下文步骤,而并非有效的长程上下文推理。为直接测试长程上下文能力,我们构建了一个数据管道,通过人为扩大输入的上下文长度(确保相关文件被正确检索),然后研究在真正的长程上下文(64k token)下的单次补丁生成。在此设置下,性能急剧下降:Qwen3-Coder-30B-A3B 在 64k 上仅实现 7% 的解决率,而 GPT-5-nano 未能解决任何任务。定性分析揭示了系统性的失败模式,包括幻觉的 diff、错误的文件目标以及格式错误的补丁标题。总体而言,我们的发现凸显了名义上下文长度与实际可用上下文容量之间的重大差距,并且表明现有的智能体编码基准测试并未从根本上评估长程上下文推理。

关键词

引用

@article{arxiv.2602.16069,
  title  = {The Limits of Long-Context Reasoning in Automated Bug Fixing},
  author = {Ravi Raju and Mengmeng Ji and Shubhangi Upasani and Bo Li and Urmish Thakker},
  journal= {arXiv preprint arXiv:2602.16069},
  year   = {2026}
}

备注

Accepted to ICLR 2026 ICBINB workshop