中文

基于执行序列的恶意软件表示学习

密码学与安全 2021-02-08 v2 机器学习

摘要

随着恶意软件数量和类型急剧增加,恶意软件分析已被广泛研究。然而,多数先前研究使用端到端系统来检测样本是否恶意,或识别其恶意软件家族。本文提出一种由嵌入器、编码器和过滤器组成的神经网络框架,从特征执行序列中学习恶意软件表示以用于家族分类。嵌入器使用最先进的嵌入模块 BERT 和 Sent2Vec,以捕获单次 API 调用内及执行轨迹中连续 API 调用间的关系。编码器由门控循环单元(GRU)和自注意力机制组成,前者保留 API 调用的顺序位置,后者用于比较 API 调用不同位置间的内在关系。过滤器识别代表性 API 调用来构建恶意软件表示。我们进行了广泛实验以确定各框架组件的影响。结果表明所提框架优于基线,并证明考虑 Sent2Vec 学习完整 API 调用嵌入及 GRU 显式保留顺序信息可带来更多信息因而显著提升。此外,所提方法基于与已收集家族的相似性有效分类新的恶意执行轨迹。

关键词

引用

@article{arxiv.1912.07250,
  title  = {Learning Malware Representation based on Execution Sequences},
  author = {Yi-Ting Huang and Ting-Yi Chen and Yeali S. Sun and Meng Chang Chen},
  journal= {arXiv preprint arXiv:1912.07250},
  year   = {2021}
}

备注

Incorrect experiment data