中文

distilled轻量级语言模型用于C/C++漏洞检测

密码学与安全 2025-10-09 v1 人工智能

摘要

现代软件系统日益复杂,导致安全漏洞的流行率上升,构成严重 breach和巨额经济损失的风险。因此,针对软件安全的稳健代码漏洞检测至关重要。尽管大型语言模型(LLMs)在自然语言处理方面展现出惊人的能力,但其在自动化代码漏洞检测方面的潜力仍未得到充分探索。本文提出FineSec——一个新型框架,通过知识蒸馏发掘LLMs的能力,实现对C/C++代码库中高效且精确的漏洞识别。FineSec利用知识蒸馈将大型教师模型中的专业知识传递给紧凑的学生模型,在最小的计算成本下实现高准确率。通过将数据准备、训练、评估和持续学习集成到统一的单任务工作流程中,FineSec提供了一套简洁的方法。广泛的C/C++代码库评估表明,其在识别复杂漏洞和逻辑缺陷方面优于基线模型和更大的LLMs,确立了FineSec作为实际可行且可扩展的实用软件安全解决方案。为促进可重复性,数据集、源代码和实验结果已公开:https://github.com/yangxiaoxuan123/FineSec_detect。

关键词

引用

@article{arxiv.2510.06645,
  title  = {Distilling Lightweight Language Models for C/C++ Vulnerabilities},
  author = {Zhiyuan Wei and Xiaoxuan Yang and Jing Sun and Zijian Zhang},
  journal= {arXiv preprint arXiv:2510.06645},
  year   = {2025}
}

备注

25 pages, 10 figures