中文

Refute-or-Promote:面向高精度 LLM 辅助缺陷发现的对抗性分阶段多智能体评审方法

密码学与安全 2026-04-22 v1 人工智能 软件工程

摘要

LLM 辅助缺陷发现面临精度危机:大量符合逻辑却错误的报告淹没维护者,损害真实发现的可信度。我们提出 Refute-or-Promote,一种推理时可靠性模式,结合 Stratified Context Hunting(SCH)进行候选生成、对抗性杀手令、上下文非对称性和 Cross-Model Critic(CMC)。在每个推广门槛上,对抗性智能体尝试驳斥候选;冷启动评审旨在减少锚定级联;跨家族评审可捕捉同家族评审遗漏的相关盲点。该管道在 31 天内覆盖 7 个目标(安全库、ISO C++ 标准、主要编译器)的活动中,在进入披露前约杀死了 171 个候选的 79%;在聚合协议子集(lcms2、wolfSSL;n=30)上,预期性杀死率为 83%。结果:发现 4 个 CVE(3 个公开,1 个密布),LWG 4549 被接受至 C++ 工作文件;5 个合并的 C++ 编辑 PR;3 个编译器一致性错误;8 个未获 CVE 的合并安全性修复;提交 1 份 RFC 9000 erratum awaiting committee review;以及 1+ 个 FIPS 140-3 规范性合规问题 awaiting coordinated disclosure——所有成果均通过外部接受度评估,而非基准测试。最具启发性的失败:十名专职评审一致批准了一个不存在的 OpenSSL CMS 模块中的 Bleichenbacher 填充 oracle;只有单个经验测试将其杀死,这激励了强制经验门槛。没有任何漏洞是由 AI 自主发现的;贡献在于外部结构,用于过滤 LLM 智能体持续的误报。作为缺陷发现之外的预备性迁移测试,简化的跨家族批判变体也解决了五个先前未解的 SymPy 实例于 SWE-bench Verified 以及一个 SWE-rebench 难任务。

引用

@article{arxiv.2604.19049,
  title  = {Refute-or-Promote: An Adversarial Stage-Gated Multi-Agent Review Methodology for High-Precision LLM-Assisted Defect Discovery},
  author = {Abhinav Agarwal},
  journal= {arXiv preprint arXiv:2604.19049},
  year   = {2026}
}

备注

10 pages, 3 tables. Artifacts: https://github.com/abhinavagarwal07/refute-or-promote (Zenodo DOI: 10.5281/zenodo.19668799)