多语言漏洞修复中大型语言模型评估
软件工程
2025-08-06 v1
摘要
已提出 various 基于深度学习的预训练语言模型方法,用于自动修复软件漏洞。然而,这些方法局限于特定编程语言(C/C++)。近期大型语言模型(LLMs)的进展提供了语言无关的能力和强大的语义理解,展示了克服多语言漏洞限制的潜力。尽管已有一些工作开始探索 LLMs 的修复性能,但其效果仍不令人满意。为克服这些限制,我们进行了一次大规模实证研究,调查了自动化漏洞修复方法和最新 LLMs 在七种编程语言中的表现。结果表明,经过指令微调的 GPT-4o 在与领先方法 VulMaster 相当的性能,此外,LLM 方法在修复独特漏洞方面表现更佳,且更可能修复最危险的漏洞。经过指令微调的 GPT-4o 在之前未见过的语言中的漏洞上展示了强大的泛化能力,超越了现有方法。分析表明,Go 在所有模型类型中始终实现最高的有效性,而 C/C++ 执行最差。基于我们的发现,我们讨论了 LLM 在多语言漏洞修复中的前景以及 LLM 失败案例的原因。这一工作首次关注多种语言的修复方法和 LLMs,凸显了采用 LLMs 进行多语言漏洞修复的广阔前景。
引用
@article{arxiv.2508.03470,
title = {On the Evaluation of Large Language Models in Multilingual Vulnerability Repair},
author = {Dong wang and Junji Yu and Honglin Shu and Michael Fu and Chakkrit Tantithamthavorn and Yasutaka Kamei and Junjie Chen},
journal= {arXiv preprint arXiv:2508.03470},
year = {2025}
}