中文

DAEMON:基于多阶段特征挖掘的与数据集无关的可解释恶意软件分类方法

密码学与安全 2021-06-28 v2 机器学习

摘要

变异型和多态型恶意变体每日由变异引擎自动大量生成,这些引擎在保留恶意程序功能的同时变换其代码,以规避基于签名的检测。这些自动化过程极大增加了恶意软件变体的数量,使得完全人工分析已不可能。恶意软件分类的任务是确定一个新的恶意变体属于哪个家族。同一恶意软件家族的变体表现出相似的行为模式。因此,对新发现的恶意程序和应用进行分类有助于评估其带来的风险。此外,恶意软件分类有助于确定哪些新发现的变体应由安全专家进行人工分析,以判断它们是否属于一个新家族(例如利用零日漏洞的家族),还是仅仅是已知恶意家族内部概念漂移的结果。这促使近年来关于设计高精度自动恶意软件分类工具的研究蓬勃发展。在本工作中,我们提出 DAEMON——一种新颖的与数据集无关的恶意软件分类器。DAEMON 的一个关键特性是其所用特征的类型及挖掘方式有助于理解恶意软件家族的区分性行为,使其分类决策具有可解释性。我们使用由针对 Windows 电脑的多个恶意软件家族混合而成的大规模 x86 二进制数据集对 DAEMON 进行了优化。随后,我们在无任何算法改动、特征重构或参数调优的情况下,对其重新训练并应用于另外两个由众多恶意软件家族组成的大规模恶意 Android 应用数据集。DAEMON 在所有数据集上均获得了高度准确的分类结果,证实了其同样与平台无关。

关键词

引用

@article{arxiv.2008.01855,
  title  = {DAEMON: Dataset-Agnostic Explainable Malware Classification Using Multi-Stage Feature Mining},
  author = {Ron Korine and Danny Hendler},
  journal= {arXiv preprint arXiv:2008.01855},
  year   = {2021}
}