基于学习的漏洞检测模型:广泛研究
软件工程
2024-08-15 v1 密码学与安全
机器学习
摘要
尽管许多基于深度学习的模型在漏洞检测方面取得了很大进展,但我们对这些模型缺乏良好的理解,这限制了模型能力的进一步发展、对模型检测机制的理解,以及实际应用中模型的效率和安全性。本文通过在最近构建的大型数据集上开展实验,对两种最新基于学习的方法(序列方法和图方法)进行广泛而全面的调查。我们从模型能力、模型解释、模型稳定性、模型易用性和模型经济性五个维度出发,探讨了七个研究问题。我们实验性地证明了序列方法的优先性,而 ChatGPT 等 LLM 和图方法的能力有限。我们探讨了基于学习的模型在哪些类型的漏洞上擅长,以及即使输入被轻微地语义等价改变后模型仍然不稳定的现象。我们经验性地解释了模型到底学习了什么。我们总结了预处理方式以及使用这些模型的要求。最后,我们最初地提炼了这些模型在经济和安全的实际使用中所需的关键信息。
引用
@article{arxiv.2408.07526,
title = {Learning-based Models for Vulnerability Detection: An Extensive Study},
author = {Chao Ni and Liyu Shen and Xiaodan Xu and Xin Yin and Shaohua Wang},
journal= {arXiv preprint arXiv:2408.07526},
year = {2024}
}
备注
13 pages, 5 figures