面向机器学习基于网络安全任务的源代码表示综述
机器学习
2025-04-10 v2 密码学与安全
摘要
针对网络安全相关软件工程任务的机器学习技术正变得越来越流行。源代码的表示方式是影响模型能否学习源代码特征的关键因素。随着这些技术的不断发展,了解当前领域的现状以更好地理解已有工作及其不足显得尤为重要。这篇文章present了一项对现有基于机器学习方法的研究,并演示了不同网络安全任务和编程语言所使用的不同表示类型。此外,我们研究了不同表示与不同模型的配合情况。我们发现图基表示是最受欢迎的表示类别,标记化器和抽象语法树 (ASTs) 是两种最受欢迎的表示方式(例如,AST 和标记化器是代表论文数量最多的表示,而图基表示是代表论文数量最多的类别)。我们还发现,最受欢迎的网络安全任务是漏洞检测,覆盖最多技术的编程语言是 C。最后,我们发现序列模型是最受欢迎的模型类别,而支持向量机是最受欢迎的模型。
引用
@article{arxiv.2403.10646,
title = {A Survey of Source Code Representations for Machine Learning-Based Cybersecurity Tasks},
author = {Beatrice Casey and Joanna C. S. Santos and George Perry},
journal= {arXiv preprint arXiv:2403.10646},
year = {2025}
}