中文

Needle in the Repo:面向 AI 生成仓库编辑可维护性的基准

软件工程 2026-03-31 v1 人工智能

摘要

AI 编码代理已能完成复杂编程任务,但现有评估主要强调行为正确性,常忽视如模块性弱或可测试性差等可维护性风险。我们提出 Needle in the Repo (NITR),这是一种用于评估行为正确的仓库编辑是否保留可维护结构的诊断探针-oracle 框架。NITR 将软件工程智慧提炼为控制探针,这些探针嵌入小型真实多文件代码库,每个代码库设计使成功主要取决于针对单一可维护维度的目标。每个探针配备隐藏的评估工具链,结合功能测试确保所需行为,同时包含编码可维护性约束的结构性 oracle,提供可解释诊断。使用 NITR,我们评估了 GPT、Claude、Gemini 和 Qwen 系列在直接推理和代理模式下的 23 种编码配置。当前 AI 编码系统仍远不完善:平均仅解答 36.2% 的案例,最佳者达 57.1%,微型案例性能从 53.5% 降至多步骤案例的 20.6%。最具挑战的是架构层面的修改,尤其是依赖控制(4.3%)和职责分解(15.2%)。此外,64/483(13.3%)的结果通过所有功能测试,却未通过结构性 oracle。在我们的工具链下,代理模式配置将平均性能从 28.2% 提升至 45.0%,但未能消除这些架构性失效。这些结果表明,代码生成的进步尚未转化为可维护的代码演进,而 NITR 揭示了常规评估忽视的关键失效面。

关键词

引用

@article{arxiv.2603.27745,
  title  = {Needle in the Repo: A Benchmark for Maintainability in AI-Generated Repository Edits},
  author = {Haichao Zhu and Qian Zhang and Jiyuan Wang and Zhaorui Yang and Yuxin Qiu},
  journal= {arXiv preprint arXiv:2603.27745},
  year   = {2026}
}

备注

16 pages, 6 figures