中文

AI 生成拉取请求的早期评审工作量预测

软件工程 2026-01-28 v2

摘要

随着 AI 编码代理从自动完成工具演变为自主的“AI 工作队”同事,它们引入了一个关键新瓶颈:人类维护者现在必须管理复杂的交互循环,而不仅仅是审查代码。分析 33,707 条由智能体编写的 PR,我们发现一个明显的两制度现实:智能体在狭窄自动化方面表现出色(28.3% 的 PR 立即合并),但在迭代细化方面经常失败,导致在面对主观反馈时出现“幽灵化”(放弃)。这会在维护者身上造成隐藏的“注意力税”。我们引入一种创建时间电路中断模型,用于预测人类审查开始前的高维护成本 PR。通过利用简单的静态复杂性线索(例如文件类型、补丁大小),我们的模型在 AUC 为 0.96 的情况下识别出高成本贡献的“尾部”,从而实现分层 triage 流程。在 20% 的审查预算下,这种方法捕获了 69% 的高-effort PR,有效地让维护者能够快速失败成本低、质量低的智能体贡献,同时快速处理简单的修复。

关键词

引用

@article{arxiv.2601.00753,
  title  = {Early-Stage Prediction of Review Effort in AI-Generated Pull Requests},
  author = {Dao Sy Duy Minh and Huynh Trung Kiet and Nguyen Lam Phu Quy and Pham Phu Hoa and Tran Chi Nguyen and Nguyen Dinh Ha Duong and Truong Bao Tran},
  journal= {arXiv preprint arXiv:2601.00753},
  year   = {2026}
}

备注

5 pages, 4 figures. Accepted to the 23rd International Conference on Mining Software Repositories (MSR '26)