面向自动漏洞修复模型的多数据集评估
软件工程
2025-06-06 v1 人工智能
摘要
软件漏洞构成重大的安全威胁,亟需有效缓解。虽然自动程序修复 (APR) 在修复通用错误方面取得了进展,但漏洞修补作为 APR 的安全关键方面仍鲜有探索。本研究 investigates 使用预训练语言模型 CodeBERT 和 CodeT5 进行跨六个数据集和四种编程语言的自动漏洞修补。我们评估它们在准确性和对未知漏洞的泛化能力。结果表明,尽管两种模型在碎片化或稀疏上下文方面面临挑战,CodeBERT 在此类情境下表现较佳,而 CodeT5 在捕捉复杂漏洞模式方面更为出色。CodeT5 还显示出优异的可扩展性。进一步,我们测试在训练集 (in-distribution) 和未见数据集 (out-of-distribution) 上的微调模型。虽然微调可提高训练集性能,但模型在泛化到未见数据方面仍存在困难,这凸显了在鲁健漏洞检测方面的挑战。该研究对模型性能进行基准测试,识别了泛化局限性,并为实际安全应用提供了可操作性见解以推动自动漏洞修补。
引用
@article{arxiv.2506.04987,
title = {A Multi-Dataset Evaluation of Models for Automated Vulnerability Repair},
author = {Zanis Ali Khan and Aayush Garg and Qiang Tang},
journal= {arXiv preprint arXiv:2506.04987},
year = {2025}
}
备注
Preprint has been accepted in ARES AI&CCPS (International Workshop on Artificial Intelligence, Cyber and Cyber-Physical Security)