中文

Quo Vadis:基于上下文与行为恶意软件表示的混合机器学习元模型

密码学与安全 2024-10-22 v2 机器学习

摘要

我们提出了一种混合机器学习架构,它同时采用多个深度学习模型来分析 Windows 可移植可执行文件(portable executable)的上下文和行为特征,并基于元模型的决策产生最终预测。当代机器学习 Windows 恶意软件分类器的检测启发式通常基于样本的静态属性,因为通过虚拟化进行动态分析对大量样本而言具有挑战性。为超越此限制,我们采用 Windows 内核仿真,能以最小的时间和计算成本获取大规模语料库上的行为模式。我们与一家安全供应商合作,收集了超过 100k 个反映当代威胁态势的 int-the-wild 样本,包含原始 PE 文件及执行时刻的应用程序文件路径。所获取的数据集比相关行为恶意软件分析工作中报告的数据集至少大十倍。训练数据集中的文件由专业威胁情报团队利用手动和自动化逆向工程工具标注。我们通过在该训练集采集三个月后收集样本外测试集来估计混合分类器的运行效用。我们报告了优于当前 state-of-the-art 模型能力的检测率,尤其在低误报要求下。此外,我们揭示了元模型能够识别验证集和测试集中的恶意活动,即便单个模型均未有足够置信度将样本标记为恶意。我们得出结论:元模型可从不同分析技术产生的表示组合中学习典型于恶意样本的模式。我们公开发布了预训练模型及匿名的仿真报告数据集。

关键词

引用

@article{arxiv.2208.12248,
  title  = {Quo Vadis: Hybrid Machine Learning Meta-Model based on Contextual and Behavioral Malware Representations},
  author = {Dmitrijs Trizna},
  journal= {arXiv preprint arXiv:2208.12248},
  year   = {2024}
}

备注

10 pages, 4 figures, 4 tables