面向文件级漏洞定位的大语言模型可能"在末尾失踪"
泛函分析
2025-03-11 v2
摘要
近期人工智能的进展使得处理更大规模输入成为可能, 日益增多的软件开发者倾向于依赖基于聊天的大语言模型( LLM )如 GPT-3.5 和 GPT-4 来检测整个文件范围内的漏洞, 而不仅限于函数内部。这种新的开发实践迫切需要研究人员调查常用 LLM 是否能有效分析大文件尺寸的输入, 以为软件开发者和工程师提供及时见解, 了解其优缺点。因此, 本文旨在评估多种最先进的聊天式 LLM, 包括 GPT 模型, 在检测文件级漏洞方面的效果。我们对 LLM 性能随漏洞类型、输入规模及漏洞在文件中位置变化的影响进行了深入调查。为保证研究统计效力, 我们仅聚焦于三类最常见且最危险的漏洞: XSS、SQL 注入和路径遍历。我们的发现表明, LLM 检测这些漏洞的效果受漏洞位置和输入整体规模的显著影响。具体而言, 无论漏洞类型如何, LLM 在检测大文件中靠近末端的漏洞时, 表现显著低于( p < .05), 我们称之为"lost-in-the-end"效应。最后, 为进一步支持软件开发者和实践者, 我们探索了这些 LLM 的最佳输入规模, 并提出一种简单策略来识别其优势, 可适用于其他模型和漏洞类型。最终展示, 调整输入规模可显著提升 LLM 基于漏洞的检测效果, 所有模型的平均召回率提升超过 37%。
引用
@article{arxiv.2502.06896,
title = {Dirichlet Spaces In Balls And Half-spaces of $\R^n$},
author = {Yan Yang and Tao Qian},
journal= {arXiv preprint arXiv:2502.06896},
year = {2025}
}