中文

LSTM 不同超参数对于入侵检测系统相对重要性的评估

密码学与安全 2021-01-01 v1 机器学习

摘要

诸如 LSTM 之类的循环深度学习语言模型常被用于为高价值资产提供高级网络防御。将 LSTM 网络用于恶意软件检测的潜在假设是,恶意软件的操作码序列可被视为一种(口语)语言表示。任何口语(词/句序列)与机器语言(操作码序列)之间存在差异。在本文中,我们证明由于这些固有差异,除非对网络的关键超参数进行适当调优,否则按口语调优默认配置的 LSTM 模型可能无法很好地检测(利用其操作码序列的)恶意软件。在此过程中,我们还确定了 LSTM 网络所有不同超参数在利用其操作码序列表示进行恶意软件检测时的相对重要性。我们尝试了 LSTM 网络的不同配置,并改变了嵌入维度、隐藏层数量、隐藏层中 LSTM 单元数量、输入向量的剪枝/填充长度、激活函数和批大小等超参数。我们发现,由于恶意软件/机器语言的复杂性增强,为入侵检测系统配置的 LSTM 网络的性能对隐藏层数量、输入序列长度和激活函数的选择非常敏感。此外,对于(口语)语言建模,循环架构的表现远优于其非循环对应架构。因此,我们还评估了诸如 LSTM 之类的序列 DL 架构与诸如 MLP-DNN 之类的非序列对应架构在恶意软件检测方面的比较。

关键词

引用

@article{arxiv.2012.14427,
  title  = {Assessment of the Relative Importance of different hyper-parameters of LSTM for an IDS},
  author = {Mohit Sewak and Sanjay K. Sahay and Hemant Rathore},
  journal= {arXiv preprint arXiv:2012.14427},
  year   = {2021}
}