低资源语言中的软件漏洞预测:基于 CodeBERT 与 ChatGPT 的实证研究
软件工程
2024-04-29 v1 密码学与安全
机器学习
摘要
背景:新兴语言中的软件漏洞预测对于确保现代系统的软件安全性日益重要。然而,这些语言通常只有有限的 SV 数据来开发高性能预测模型。目的:我们开展了一项实证研究,以评估新兴语言中 SV 数据稀缺对最先进 SV 预测模型的影响,并探索提升性能的潜在解决方案。方法:我们基于 CodeBERT 训练并测试了最先进的模型,在三种低资源语言——Kotlin、Swift 和 Rust 中,分别结合与不结合数据采样技术进行函数级和行级 SV 预测。鉴于 ChatGPT 近期在其他领域的成功,我们还评估了其在低资源 SV 预测中的有效性。结果:与在拥有大量数据的 C/C++ 上的原始工作相比,CodeBERT 在低资源语言中的函数级和行级 SV 预测性能显著下降,表明了数据稀缺的负面影响。在补救措施方面,数据采样技术未能改进 CodeBERT;而 ChatGPT 展示了有希望的结果,在函数级上最高提升 34.4%,在行级上最高提升 53.5% 的预测性能。结论:我们突出了这一挑战,并为低资源 SV 预测迈出了有希望的第一步,为未来该方向的研究铺平了道路。
引用
@article{arxiv.2404.17110,
title = {Software Vulnerability Prediction in Low-Resource Languages: An Empirical Study of CodeBERT and ChatGPT},
author = {Triet H. M. Le and M. Ali Babar and Tung Hoang Thai},
journal= {arXiv preprint arXiv:2404.17110},
year = {2024}
}
备注
Accepted in the 4th International Workshop on Software Security co-located with the 28th International Conference on Evaluation and Assessment in Software Engineering (EASE) 2024