中文

通过超参数优化改进安全缺陷报告分类

软件工程 2019-05-17 v1

摘要

当安全缺陷被检测到时,应当(a)由安全软件工程师私下讨论;并且(b)在提供安全补丁之前不向大众公开。软件工程师通常将缺陷报告至缺陷跟踪系统,并将其标记为安全缺陷报告(SBRs)或非安全缺陷报告(NSBRs),而SBRs比NSBRs具有更高的优先级,需在被攻击者利用之前修复。然而,由于错误标记问题(即将安全缺陷报告误标为非安全缺陷报告),疑似安全缺陷报告经常被公开披露。本文的目标是通过对学习器和数据预处理器的参数调优,帮助软件开发人员更好地将识别安全漏洞的缺陷报告分类为安全缺陷报告。先前的工作已应用文本分析和机器学习学习器来分类所报告的缺陷是否与安全相关。我们在该工作的基础上进行了改进,这体现在我们对五个开源项目的分析中。我们将超参数优化应用于(a)学习器的控制参数;以及(b)处理目标类仅占所有数据一小部分情况的数据预处理方法。我们表明,优化预处理器比优化学习器更有用。我们还表明,我们的方法所带来的改进可能非常显著。例如,使用与近期基线方法所分析的相同数据集,我们展示了调整数据预处理可使分类召回率提升35%至65%(中位数到最大值),且假阳性率有适度增加。

关键词

引用

@article{arxiv.1905.06872,
  title  = {Better Security Bug Report Classification via Hyperparameter Optimization},
  author = {Rui Shu and Tianpei Xia and Laurie Williams and Tim Menzies},
  journal= {arXiv preprint arXiv:1905.06872},
  year   = {2019}
}

备注

12 pages, 1 figure, submitted to 34th IEEE/ACM International Conference on Automated Software Engineering (ASE 2019)