中文

基于多任务的开源大语言模型软件漏洞评估

软件工程 2024-07-09 v3

摘要

本文提出了一种用于定量评估交互式大语言模型(LLM)的管道,使用公开可用的数据集。我们利用覆盖四种不同常见软件漏洞任务的 Big-Vul 数据集,对 LLM 进行了广泛的技术评估。该评估基于此数据集 assesses LLM 的多任务能力。我们发现,现有的领先方法和预训练语言模型(LM)在软件漏洞检测方面通常优于 LLM。然而,在软件漏洞评估和定位方面,某些 LLM(如 CodeLlama 和 WizardCoder)的表现优于预训练 LM,且提供更多的上下文信息可以增强 LLM 的漏洞评估能力。此外,LLM 在漏洞描述方面表现出强大的能力,但其倾向于产生过度输出显著削弱了其性能,相较于预训练 LM 表现更差。总体而言,尽管 LLM 在某些方面表现良好,但在理解代码漏洞细微差异以及完全实现其潜力的能力来描述漏洞方面仍有待提高。我们的评估管道为了解 LLM 处理软件漏洞的能力提供了宝贵的见解。

关键词

引用

@article{arxiv.2404.02056,
  title  = {Multitask-based Evaluation of Open-Source LLM on Software Vulnerability},
  author = {Xin Yin and Chao Ni and Shaohua Wang},
  journal= {arXiv preprint arXiv:2404.02056},
  year   = {2024}
}