中文

从描述到评分:大语言模型能否量化漏洞?

密码学与安全 2026-01-06 v3 人工智能 编程语言

摘要

手动对漏洞进行评分(例如分配常见漏洞评分系统(CVSS)分数)是一种耗资源的 process,常受主观解释的影响。本研究调查了通用大型语言模型(LLM),即 ChatGPT、Llama、Grok、DeepSeek 和 Gemini,自动化这一 process 的潜力,通过分析超过 31000 条最近的常见漏洞与暴露(CVE)条目。结果表明,LLM 在某些指标上(例如“Availability Impact”)显著优于基线,而在其他指标上(例如“Attack Complexity”)则取得了有限的提升。此外,模型性能在不同的 LLM family 以及 individual CVSS 指标之间存在差异,以 ChatGPT-5 实现的最高精度。我们的分析表明,LLM 往往会对许多相同的 CVEs 进行错误分类,集成-based meta-classifier 仅在性能上略有提升。进一步的检查显示,CVE 描述常常缺乏关键 context 或包含模糊表述,这导致系统性误分类。这些发现凸显了增强漏洞描述并 incorporating 更丰富 context 细节的重要性,以支持更可靠的自动推理并缓解日益增长的待分类 CVEs backlog。

关键词

引用

@article{arxiv.2512.06781,
  title  = {From Description to Score: Can LLMs Quantify Vulnerabilities?},
  author = {Sima Jafarikhah and Daniel Thompson and Eva Deans and Hossein Siadati and Yi Liu},
  journal= {arXiv preprint arXiv:2512.06781},
  year   = {2026}
}

备注

10 pages