中文

评估LLMs用于单次修补真实与人工漏洞的能力

密码学与安全 2025-12-01 v1 人工智能 软件工程

摘要

自动化漏洞修补对于软件安全至关重要,近期大语言模型(LLM)的突破为自动化这一任务提供了有前景的能力。然而,现有研究主要评估LLM在公开披露的漏洞上的效果,而对其在相关人工漏洞上的有效性则鲜有探讨。本研究使用Proof-of-Vulnerability(PoV)测试执行,对几款主流大语言模型(如OpenAI的GPT变体、LLaMA、DeepSeek和Mistral模型)进行真实与人工漏洞的修补效果和互补性进行经验性评估。我们的结果表明,LLM在修补真实漏洞的效果优于人工漏洞。此外,我们的分析揭示了LLM在重叠性(多个LLM同时修补同一漏洞)和互补性(仅由单个LLM修补的漏洞)方面存在显著差异,强调为获得有效漏洞修补的重要性。

关键词

引用

@article{arxiv.2511.23408,
  title  = {Evaluating LLMs for One-Shot Patching of Real and Artificial Vulnerabilities},
  author = {Aayush Garg and Zanis Ali Khan and Renzo Degiovanni and Qiang Tang},
  journal= {arXiv preprint arXiv:2511.23408},
  year   = {2025}
}

备注

Pre-print - Extended version of the poster paper accepted at the 41st ACM/SIGAPP Symposium on Applied Computing (SAC) Smarter Engineering-Building AI and Building with AI (SEAI) 2026