中文

大数据网络安全分析系统的可扩展性研究

密码学与安全 2021-12-03 v1

摘要

大数据网络安全分析(BDCA)系统利用大数据技术(如 Apache Spark)来收集、存储并分析海量安全事件数据以检测网络攻击。总体而言数字数据量以及具体而言安全事件数据量正呈指数增长。安全事件数据生成并输入 BDCA 系统的速度不可预测。因此,BDCA 系统应具备高度可扩展性,以应对安全事件数据速度不可预测的增减。然而,迄今甚少有工作考察 BDCA 系统的可扩展性以识别并利用可扩展性改进的源头。本文中,我们首先考察了采用默认 Spark 设置的基于 Spark 的 BDCA 系统的可扩展性;随后识别出可显著影响 BDCA 系统可扩展性的 Spark 配置参数(如执行内存)。基于所识别的参数,我们最终提出一种参数驱动的适配方法 SCALER,用于优化系统可扩展性。我们在一大规模 OpenStack 集群上实现基于 Spark 的 BDCA 系统并进行了一组实验。我们使用四个安全数据集运行实验。我们发现:(i)采用默认 Spark 配置参数的 BDCA 系统偏离理想可扩展性达 59.5%;(ii)所研究的 11 个 Spark 配置参数中有 9 个显著影响可扩展性;(iii)与默认 Spark 参数设置下的可扩展性相比,SCALER 将 BDCA 系统的可扩展性提升了 20.8%。我们的研究结果表明,探索底层大数据框架(如 Apache Spark)的参数空间对于可扩展的网络安全分析至关重要。

关键词

引用

@article{arxiv.2112.00853,
  title  = {On the Scalability of Big Data Cyber Security Analytics Systems},
  author = {Faheem Ullah and Muhammad Ali Babar},
  journal= {arXiv preprint arXiv:2112.00853},
  year   = {2021}
}