中文

基于多输入模型的动态数据融合用于恶意软件分类

密码学与安全 2019-10-07 v1 机器学习 机器学习

摘要

犯罪分子利用恶意软件破坏网络系统。随着车辆、路由器和灯泡等普通系统日益互联为网络系统,这些易受恶意软件攻击的系统数量正快速增加。为应对此问题的规模,分析人员将恶意软件划分为类别,并为每一类开发专门防御。在本项目中,我们使用机器学习对恶意软件进行分类。具体而言,我们采用了有监督多类长短期记忆(LSTM)模型。我们用数千个带类别标注(训练集)的恶意软件文件训练算法,算法学习了每一类的指示性模式。我们使用反汇编的恶意软件文件(由 Microsoft 提供),并将其中数据分为已解析指令(类似人类可读的机器码文本)和原始字节(十六进制值)。我们关注哪种格式(文本或十六进制)作为分类输入更有价值。为此,我们研究了四种情况:仅文本模型、仅十六进制模型、同时使用文本与十六进制输入的多输入模型,以及基于合并单独结果的模型。我们使用机器学习 Python 包 Keras 进行该研究,其允许轻松配置深度学习架构与训练。我们希望理解不同格式间的权衡。由于数据中的类别不平衡,我们使用多种方法比较格式,包括测试准确率、平衡准确率(考虑类别权重)以及由混淆矩阵表导出的准确率。我们发现,允许同时在两类输入上学习的多输入模型取得了最佳性能。我们的发现通过为研究人员提供合适的深度学习架构以训练针对其恶意软件的定制版本,加速了恶意软件分类研究。

关键词

引用

@article{arxiv.1910.02021,
  title  = {Dynamic data fusion using multi-input models for malware classification},
  author = {Viktor Zenkov and Jason Laska},
  journal= {arXiv preprint arXiv:1910.02021},
  year   = {2019}
}

备注

6 figures