考虑概念漂移的自动化软件漏洞评估
软件工程
2021-03-23 v1 密码学与安全
摘要
软件工程研究者正日益使用自然语言处理(NLP)技术,利用公共仓库中的描述来自动化软件漏洞(SVs)评估。然而,现有基于NLP的方法受概念漂移困扰。该问题源于随时间推移对未见SVs评估时新词(词表外)术语缺乏妥善处理。为利用SVs描述执行考虑概念漂移的自动化SVs评估,我们提出一种结合字符与词特征的系统方法。所提方法用于预测七种漏洞特征(VCs)。每种VC的最优模型通过我们定制的时间交叉验证方法,从八个NLP表示与六种知名机器学习模型列表中选出。我们使用所提方法对国家漏洞数据库(NVD)中超过100,000个SVs进行大规模实验。结果表明,即便不重新训练模型,我们的方法也能有效应对NVD中2000至2018年报告的SVs描述概念漂移问题。此外,与现有仅用词方法相比,我们的方法具竞争力。我们还探究了如何用远少特征构建紧凑的概念漂移感知模型,并给出了SVs评估中分类器与NLP表示选择的建议。
引用
@article{arxiv.2103.11316,
title = {Automated Software Vulnerability Assessment with Concept Drift},
author = {Triet H. M. Le and Bushra Sabir and M. Ali Babar},
journal= {arXiv preprint arXiv:2103.11316},
year = {2021}
}
备注
Published as a full paper at the 16th International Conference on Mining Software Repositories 2019