筛除噪声:LLM 智能体在漏洞误报过滤中的比较研究
软件工程
2026-02-02 v1
摘要
静态应用安全测试(SAST)工具是识别软件漏洞的必备工具,但常常会产生大量误报(FP),给开发人员带来巨大的手动 triage 负担。最近在大型语言模型(LLM)智能体方面的进展提供了一条有前景的道路,通过启用迭代推理、工具使用和环境交互来细化 SAST 报警。然而,不同 LLM 基于智能体架构在误报过滤中的比较效果仍鲜有了解。本文我们对三种最先进的 LLM 基于智能体框架,即 Aider、OpenHands 和 SWE-agent,在漏洞误报过滤中的进行比较研究。我们使用 OWASP Benchmark 中的漏洞以及真实的开源 Java 项目进行评估。实验结果表明,LLM 基于智能体能够消除大部分 SAST 噪声,将 OWASP Benchmark上的初始误报检测率从 92% 以上降低至最佳配置下仅 6.3%。在真实数据集上,最佳配置的 LLM 基于智能体可实现误报识别率最高可达 93.3%。然而,智能体的优势在 backbone 模型和 CWE 类别之间具有强烈依赖性:对于像 Claude Sonnet 4 和 GPT-5 这类强大模型,智能体框架显著优于基础提示方法,但对于较弱的 backbone 模型,仅带来有限或不一致的收益。此外,激进的误报减少可能以压制真实漏洞为代价为代价,凸显了重要的权衡。最后,我们观察到不同智能体框架之间的计算成本差异巨大。总体而言,本研究表明 LLM 基于智能体是 SAST 误报过滤的强大但非均匀解决方案,其实际部署需要仔细考虑智能体设计、 backbone 模型选择、漏洞类别以及运营成本。
引用
@article{arxiv.2601.22952,
title = {Sifting the Noise: A Comparative Study of LLM Agents in Vulnerability False Positive Filtering},
author = {Yunpeng Xiong and Ting Zhang},
journal= {arXiv preprint arXiv:2601.22952},
year = {2026}
}