Meta 低风险代码审查自动化:RADAR、风险校准与审查效率
软件工程
2026-05-29 v1 人工智能
摘要
AI 辅助编码工具已改变软件生产。Meta 人类提交的 diff 行数年增 105.9%,开发人员提交的 diff 量增长 51%,其中智能体 AI 负责该增长的 80%以上。与此同时,接收及时审查的 diff 比例下降,导致代码供给与审查者带宽之间的差距扩大。我们提出三个问题从可行性到校准再到影响: (1) 风险分层自动化能否在跨组织的规模化运行, (2) 调整风险阈值如何影响自动化产出与安全之间的权衡, (3) 自动审查是否减少 AI 生成变更的端到端延迟。我们部署了 RADAR(风险感知 diff 自动审查),一个多阶段漏斗对每个 diff 按作者和来源类型进行分类,应用资格门槛、静态启发式、机器学习 diff 风险评分、基于 LLM 的自动代码审查,以及确定性验证后 landing 合格变更。我们通过覆盖 535K+ RADAR 审查 diff 的遥测数据、政策变更的观察性前后比较,以及审查结果效率的差分-差分分析来评估 RADAR。RADAR 已审查 535K+ diff 并 landing 331K+。将 diff 风险评分阈值从 25 百分位放宽至 50 百分位,批准率提升至 60.31%。RADAR 审查的 diff 回滚率为非 RADAR diff 的 1/3,生产事件率为非 RADAR diff 的 1/50。RADAR 将关闭中位数时间缩短 330%+,diff 审查墙面时间缩短 35%。风险感知分层自动化可在不妥协生产安全的情况下实质性地减少 AI 驱动代码增长所创建的审查瓶颈。
引用
@article{arxiv.2605.30208,
title = {Automating Low-Risk Code Review at Meta: RADAR, Risk Calibration, and Review Efficiency},
author = {Chris Adams and Arjun Singh Banga and Parveen Bansal and Souvik Bhattacharya and Rujin Cao and Pedro Canahuati and Nate Cook and Brian Ellis and Prabhakar Goyal and Gurinder Grewal and Tianyu He and Matt Labunka and Alex Manners and David Molnar and Ging Cee Ng and Vishal Parekh and Jiefu Pei and Frederic Sagnes and James Saindon and Will Shackleton and Sid Sidhu and Gursharan Singh and Karthik Chengayan Sridhar and Matt Steiner and Pratibha Udmalpet and Sean Xia and Stacey Yan and Audris Mockus and Peter Rigby and Nachiappan Nagappan},
journal= {arXiv preprint arXiv:2605.30208},
year = {2026}
}