让审判开始:基于LLM代理的漏洞检测模拟法庭方法
软件工程
2025-12-05 v2 人工智能
摘要
检测源代码中的漏洞仍是一个至关紧急且富有挑战性的任务,尤其当良性函数和漏洞函数共享大量相似之处时。在本工作中,我们引入了VulTrial,一个受法庭启发的多智能体框架,用于识别漏洞代码并提供解释。它采用四个角色特定的代理:安全研究员、代码作者、主持人和审议委员会。使用GPT-4o作为基础 LLM,VulTrial几乎翻倍了了先前最佳基线的效能。此外,我们展示了使用少量数据进行角色特定指令调优可显著进一步提升VulTrial的效能。我们的广泛实验表明,VulTrial在不同 LLMs 上都具有效能,包括可部署的开源模型(LLaMA-3.1-8B),以及其生成解释的高质量以及其发现多个已确认零日漏洞的能力。
引用
@article{arxiv.2505.10961,
title = {Let the Trial Begin: A Mock-Court Approach to Vulnerability Detection using LLM-Based Agents},
author = {Ratnadira Widyasari and Martin Weyssow and Ivana Clairine Irsan and Han Wei Ang and Frank Liauw and Eng Lieh Ouh and Lwin Khin Shar and Hong Jin Kang and David Lo},
journal= {arXiv preprint arXiv:2505.10961},
year = {2025}
}