中文

利用大语言模型进行安全咨询调查:进展如何?

密码学与安全 2025-06-17 v1 软件工程

摘要

大语言模型(LLMs)越来越多地应用于软件安全领域,但其在生成准确漏洞公告方面的可信度仍不确定。本研究调查了ChatGPT的能力,包括:(1)从CVE编号生成合理的安全公告,(2)区分真实与虚假的CVE编号,以及(3)从公告描述中提取CVE编号。使用一个包含100个真实和100个虚假CVE编号的精选数据集,我们手动分析了模型输出的可信度和一致性。结果表明,ChatGPT为96%的真实CVE编号输入和97%的虚假CVE编号输入生成了合理的安全公告,展示了在区分真实与虚假编号方面的局限性。此外,当将这些生成的公告重新输入ChatGPT以识别其原始CVE编号时,模型在6%的真实公告案例中产生了虚假CVE编号。这些发现凸显了ChatGPT在网络安全应用中的优势与局限。虽然该模型展示了自动化公告生成的潜力,但其无法可靠地认证CVE编号或在重新评估时保持一致性,强调了其在关键安全任务中部署的风险。本研究强调了在网络安全工作流程中谨慎使用LLMs的重要性,并指出了需要进一步改进其设计以提高可靠性和适用性。

关键词

引用

@article{arxiv.2506.13161,
  title  = {Using LLMs for Security Advisory Investigations: How Far Are We?},
  author = {Bayu Fedra Abdullah and Yusuf Sulistyo Nugroho and Brittany Reid and Raula Gaikovina Kula and Kazumasa Shimari and Kenichi Matsumoto},
  journal= {arXiv preprint arXiv:2506.13161},
  year   = {2025}
}

备注

6 pages, 6 figures, 8 tables, conference paper