关于通过指令微调本地大语言模型识别软件漏洞的有效性
密码学与安全
2025-12-24 v1 人工智能
摘要
大型语言模型(Large Language Model, LLM)在自动化软件漏洞分析中展现出巨大的潜力,这是一项因现代软件系统安全失效而产生的关键性任务。然而,当前大多数利用 LLM 自动化漏洞分析的方法依赖于在线 API 服务,需将源代码暴露给用户;且主要将任务定义为二元分类(漏洞或不漏洞),限制了其实际实用性。本文通过将问题重新表述为软件漏洞识别(Software Vulnerability Identification, SVI),使 LLM 输出常见弱点枚举(Common Weakness Enumeration, CWE)ID 而非仅指示漏洞的存在或缺失,来克服上述局限性。我们也通过演示指令微调较小且可本地部署的 LLM 即可实现优异的识别性能来解决对大型 API LLM 的依赖。在分析中,指令微调本地 LLM 在整体性能和成本权衡方面优于线上 API LLM。我们的发现表明,指令微调的本地模型代表一种更有效、更安全、更实用的方法,适用于实际的漏洞管理工作流程。
引用
@article{arxiv.2512.20062,
title = {On the Effectiveness of Instruction-Tuning Local LLMs for Identifying Software Vulnerabilities},
author = {Sangryu Park and Gihyuk Ko and Homook Cho},
journal= {arXiv preprint arXiv:2512.20062},
year = {2025}
}
备注
The 9th International Conference on Mobile Internet Security (MobiSec 2025)