中文

更安全的构建者,更冒险的维护者:人类与智能体拉取请求中破坏性变更的比较研究

软件工程 2026-03-31 v1 人工智能

摘要

AI 编码智能体正越来越多地集成到现代软件工程工作流程中,与人类开发者积极协作,在开源仓库中创建拉取请求。尽管编码智能体提高了开发者的生产力,但它们生成的代码通常比人类编写的代码包含更多的错误和安全问题。虽然人类编写的拉取请求经常破坏向后兼容性,导致破坏性变更,但智能体拉取请求引入破坏性变更的可能性仍未得到充分探索。本文旨在通过考察 AI 智能体引入破坏性变更的频率和任务上下文,帮助开发者和研究人员评估 AI 生成的拉取请求的可靠性。我们对 AIDev 数据集中 Python 仓库的 7,191 个智能体生成的拉取请求与 1,402 个人类编写的拉取请求进行了比较分析。我们开发了一个工具,用于分析与智能体拉取请求对应的提交中的代码变更,并利用基于抽象语法树的分析来检测潜在的破坏性变更。我们的发现表明,在代码生成任务中,AI 智能体总体上比人类引入更少的破坏性变更(3.45% 对 7.40%)。然而,在维护任务中,智能体表现出显著更高的风险,重构和杂项变更引入破坏性变更的比例分别达到 6.72% 和 9.35%。我们还发现了一个“信心陷阱”,即高置信度的智能体拉取请求仍然会引入破坏性变更,这表明无论报告的置信度分数如何,在面向维护的变更期间都需要进行更严格的审查。

关键词

引用

@article{arxiv.2603.27524,
  title  = {Safer Builders, Risky Maintainers: A Comparative Study of Breaking Changes in Human vs Agentic PRs},
  author = {K M Ferdous and Dipayan Banik and Kowshik Chowdhury and Shazibul Islam Shamim},
  journal= {arXiv preprint arXiv:2603.27524},
  year   = {2026}
}

备注

Accepted at 23rd International Conference on Mining Software Repositories (MSR), 2026