面向文件级漏洞定位的大型语言模型可能“入不门暗”
软件工程
2025-02-12 v1 人工智能
摘要
人工智能的最新进展使处理更大输入的能力得到提升,日常软件开发人员越来越依赖基于聊天的大型语言模型(如 GPT-3.5 和 GPT-4)来检测整个文件范围内的漏洞,而不仅限于函数内部。这一新发展实践迫切需要研究人员调查这些常用大型语言模型是否能够有效分析大文件大小的输入,以为软件开发人员和工程师提供及时见解,关于这种新兴技术趋势的优缺点。因此,本文旨在评估包括 GPT 模型在内的几种最先进聊天式大型语言模型在检测文件内漏洞方面的效果。我们对 LLM 性能随漏洞类型、输入大小和文件内漏洞位置变化的进行了高成本调查。为保证研究的统计功效,我们只能聚焦于三类最常见且最危险的漏洞:XSS、SQL 注入和路径遍历。我们的发现表明,LLM 检测这些漏洞的效果受漏洞位置和输入整体大小的显著影响。具体而言,无论漏洞类型,LLM 在检测位于大文件末端的漏洞时表现显著(p < .05)下降,我们将这一模式称为“末端隐形”效应。最后,为进一步支持软件开发人员和实践者,我们还探索了这些 LLM 的最佳输入大小,并提出了一种简单策略来识别它,可应用于其他模型和漏洞类型。最终,我们展示了调整输入大小如何导致 LLM-based 漏洞检测显著提高,所有模型的平均召回率提升超过 37%。
引用
@article{arxiv.2502.06898,
title = {Large Language Models for In-File Vulnerability Localization Can Be "Lost in the End"},
author = {Francesco Sovrano and Adam Bauer and Alberto Bacchelli},
journal= {arXiv preprint arXiv:2502.06898},
year = {2025}
}
备注
Accepted for publication at the ACM International Conference on the Foundations of Software Engineering (FSE) 2025. Replication Package: https://doi.org/10.5281/zenodo.14840519