中文

如何更好区分安全缺陷报告(使用双重超参数优化)

软件工程 2021-03-19 v3

摘要

背景:为使公众不受黑客攻击,安全缺陷报告需要在广泛讨论之前由小型工程师团队处理。但学习如何区分安全缺陷报告与其他缺陷报告具有挑战性,因为它们可能很少出现。能够找到此类稀缺目标的数据挖掘方法需要大量的优化工作。目标:本研究的目标是帮助从业者在努力优化试图区分罕见安全缺陷报告与其他缺陷报告的方法时提供支持。方法:我们提出的方法称为Swift,是一种同时优化学习器和预处理器选项的双重优化器。由于这是一个庞大的选项空间,Swift使用了一种称为ε-支配(epsilon-dominance)的技术,学习如何避免不能显著改善性能的操作。结果:与近期最先进的结果(来自发表于TSE'18的FARSEC)相比,我们发现Swift对学习器和预处理器的双重优化比单独优化其中任一个更有用。例如,在来自Chromium数据集的安全缺陷报告研究中,FARSEC和Swift的中位召回率分别为15.7%和77.4%。再例如,在使用Ambari项目数据的实验中,中位召回率从21.5%(FARSEC)提高到85.7%(Swift)。结论:总体而言,我们的方法能够快速优化模型,取得比先前最先进方法更好的召回率。这些召回率的提升伴随着假正率的适度增加(中位值从8%到24%)。对于未来工作,这些结果表明双重优化既实用又有用。

关键词

引用

@article{arxiv.1911.02476,
  title  = {How to Better Distinguish Security Bug Reports (using Dual Hyperparameter Optimization},
  author = {Rui Shu and Tianpei Xia and Jianfeng Chen and Laurie Williams and Tim Menzies},
  journal= {arXiv preprint arXiv:1911.02476},
  year   = {2021}
}

备注

arXiv admin note: substantial text overlap with arXiv:1905.06872