中文

超越静态工具:评估大语言模型在密码学误用检测中的表现

密码学与安全 2024-11-18 v1 机器学习

摘要

大语言模型(LLM)在软件开发中的应用日益增长,开发者越来越依赖这些模型进行编码辅助,包括安全关键任务。本文在密码学 API 误用检测方面,对传统静态分析工具——CryptoGuard、CogniCrypt 和 Snyk Code——与大语言模型——GPT 和 Gemini——进行了全面比较。利用基准数据集(OWASP、CryptoAPI 和 MASC),评估每种工具识别密码学误用的有效性。结果显示,GPT-4o-mini 在 CryptoAPI 和 MASC 数据集上超越了当前最先进的静态分析工具,尽管在 OWASP 数据集上表现落后。此外,我们评估 LLM 回复的质量,以确定哪些模型能提供可操作且准确的建议,为开发者提供关于其在安全编码中实际效用的见解。该研究突出了静态分析与 LLM 驱动方法的比较优势与局限,为 AI 在推进软件安全实践中不断演变的角色提供了宝贵见解。

关键词

引用

@article{arxiv.2411.09772,
  title  = {Beyond Static Tools: Evaluating Large Language Models for Cryptographic Misuse Detection},
  author = {Zohaib Masood and Miguel Vargas Martin},
  journal= {arXiv preprint arXiv:2411.09772},
  year   = {2024}
}