细调语言模型自动漏洞修复能力的再思考
软件工程
2025-12-30 v1
摘要
学习驱动的自动漏洞修复(AVR)技术利用细调语言模型已在生成漏洞补丁方面显示出前景,但其修复未见漏洞的能力仍存疑问。我们的实证研究揭示,最先进的模型常常过度拟合训练集,且评估时使用的训练、验证和测试集并非互斥。此外,依赖于基于匹配的指标将生成的补丁与参考修复在标记级别进行比较,有一定局限,未能考虑多种有效方式来修补漏洞的可能性。本文从三个方面考察最先进细调AVR模型的能力以及基于匹配的评估指标的充分性。第一,我们对测试集应用语义保持变换,以确定模型是否真正学习了稳健的漏洞修复模式,或仅依赖虚假特征。第二,我们重新划分训练、验证和测试集,使其互斥,并在修订后的测试集上评估模型,以评估其泛化能力。第三,我们引入L-AVRBench,一个专为学习驱动AVR设计的基于测试的基准,旨�克克服基于匹配的指标局限,考察AVR模型的真实修复能力。
关键词
引用
@article{arxiv.2512.22633,
title = {Rethinking the Capability of Fine-Tuned Language Models for Automated Vulnerability Repair},
author = {Woorim Han and Yeongjun Kwak and Miseon Yu and Kyeongmin Kim and Younghan Lee and Hyungon Moon and Yunheung Paek},
journal= {arXiv preprint arXiv:2512.22633},
year = {2025}
}
备注
To appear at ICSE 26. 13 pages