大语言模型无法可靠检测 JavaScript 中的漏洞:第一个系统性基准与评估
密码学与安全
2025-12-02 v1 计算与语言
软件工程
摘要
研究人员提出了诸多方法来检测 JavaScript 中的漏洞,尤其是借助大语言模型(LLM)的方法。然而,LLM 在 JavaScript 漏洞检测方面的实际能力仍值得质疑,这迫切需要进行系统评估和全面基准测试。不幸的是,现有基准存在三个关键局限性:(1) 覆盖不完整,例如仅覆盖有限子集的 CWE 类型;(2) 由于不合理的 ground truth 标记而低估了 LLM 能力;(3) 由于使用孤立漏洞文件而非完整项目等不现实案例而高估。本文首次提出构建 JavaScript 漏洞检测基准的三个原则,直接解决上述局限性:(1) 完整性,(2) 不低估,(3) 不高估。遵循这些原则,我们提出了 FORGEJS——用于评估 LLM 在 JavaScript 漏洞检测方面能力的自动基准生成框架。随后,我们使用 FORGEJS 构建了 ARENAJS——首个针对 LLM 基于 JavaScript 漏洞检测的系统性基准——进一步提出了 JUDGEJS——一个自动评估框架。我们利用 JUDGEJS 对七个流行商业 LLM 在 ARENAJS 上进行了首次系统评估。结果表明,LLM 不仅表现出有限的推理能力,而且还存在严重的鲁棒性缺陷,表明使用 LLM 实现可靠的 JavaScript 漏洞检测仍是开放挑战。
引用
@article{arxiv.2512.01255,
title = {Large Language Models Cannot Reliably Detect Vulnerabilities in JavaScript: The First Systematic Benchmark and Evaluation},
author = {Qingyuan Fei and Xin Liu and Song Li and Shujiang Wu and Jianwei Hou and Ping Chen and Zifeng Kang},
journal= {arXiv preprint arXiv:2512.01255},
year = {2025}
}