中文

基于共享与语言特定知识的多语言漏洞检测增强预训练语言模型

多媒体 2025-10-07 v1 信息检索

摘要

软件漏洞(SV)构成安全关键系统的严重威胁,推动AI方法(如机器学习和深度学习)在软件漏洞检测中的采用。尽管取得了有希望的成果,大多数现有方法仅限于单一编程语言。这一点尤其 problematic,因为现代软件往往是多语言编写且结构复杂。当前方法面临捕捉源代码的共享知识与语言特定知识的挑战,这会限制其在多样化编程语言和真实代码库上的性能。为填补这一空白,我们提出MULVULN,一种新的多语言漏洞检测方法,从多个编程语言的源代码中进行学习。MULVULN捕捉可跨语言推广的共享知识以及反映特定编码惯例的语言特定知识。通过整合这两方面,实现了对真实世界多语言软件系统中漏洞的更稳健、更有效的检测。针对真实世界且多样化的REEF数据集进行严格且广泛的实验,该数据集包含4,466个CVEs和30,987个补丁,覆盖七种编程语言,实验结果表明MULVULN在十三种有效且最新的基线方法上显著优于后者。值得注意的是,MULVULN的F1分数提升幅度从1.45%到23.59%。

关键词

引用

@article{arxiv.2510.04396,
  title  = {Evaluating Keyframe Layouts for Visual Known-Item Search in Homogeneous Collections},
  author = {Bastian Jäckl and Jiří Kruchina and Lucas Joos and Daniel A. Keim and Ladislav Peška and Jakub Lokoč},
  journal= {arXiv preprint arXiv:2510.04396},
  year   = {2025}
}

备注

28 Pages, 17 Figures