提示优先级:评估大语言模型用于漏洞分类与优先级排序的初步研究
密码学与安全
2025-10-22 v1
摘要
安全分析师面临着对庞大而复杂的漏洞积压进行分类的日益增长的压力。大语言模型通过自动化部分解释过程提供了潜在的帮助。我们评估了四种模型(ChatGPT、Claude、Gemini和DeepSeek)在十二种提示技术下解释半结构化和非结构化漏洞信息的能力。作为一个具体用例,我们测试了每个模型预测利益相关者特定漏洞分类框架中决策点(利用性、可自动化性、技术影响、任务与福祉)的能力。使用来自VulZoo数据集的384个真实世界漏洞,我们发出了超过165,000次查询,以评估在包括单样本、少样本和思维链等提示风格下的性能。我们报告了每个SSVC决策点的F1分数以及最终SSVC决策结果的Cohen's kappa(加权和未加权)。Gemini始终排名最高,在四个决策点中的三个上领先,并给出了最正确的建议。使用示例进行提示通常能提高准确性,尽管所有模型在某些决策点上仍存在困难。只有DeepSeek在加权指标下达到了一致性,并且所有模型都倾向于过度预测风险。总体而言,当前的大语言模型无法取代专家判断。然而,特定的大语言模型和提示组合对于针对性的SSVC决策显示出中等有效性。在谨慎应用的情况下,大语言模型可以支持漏洞优先级排序工作流程,并帮助安全团队更有效地应对新兴威胁。
引用
@article{arxiv.2510.18508,
title = {Prompting the Priorities: A First Look at Evaluating LLMs for Vulnerability Triage and Prioritization},
author = {Osama Al Haddad and Muhammad Ikram and Ejaz Ahmed and Young Lee},
journal= {arXiv preprint arXiv:2510.18508},
year = {2025}
}
备注
19 pages, 8 figures