从上下文学习:利用与解释文件路径信息以改进恶意软件检测
密码学与安全
2019-05-20 v1 人工智能
机器学习
摘要
用于静态可移植可执行文件(PE)恶意软件检测的机器学习(ML)通常采用每文件数值特征向量表示作为输入,并在训练期间带有一个或多个目标标签。然而,从文件出现的“上下文”中可获取许多正交信息。在本文中,我们提出利用一种静态上下文来源——PE 文件的路径——作为分类器的辅助输入。虽然文件路径本身并非恶意或良性,但它们确实为恶意/良性判定提供了有价值的上下文。与动态上下文信息不同,文件路径开销极小,并可无缝集成到多视角静态 ML 检测器中,以极小的基础设施改动在极高吞吐下获得更高检测率。此处我们提出一种多视角神经网络,其将来自 PE 文件内容的特征向量以及相应文件路径作为输入并输出检测分数。为确保评估真实,我们使用约 1000 万样本的数据集——来自实际安全厂商网络用户端点的文件与文件路径。然后我们通过 LIME 建模进行可解释性分析,以确保分类器学到了合理的表示,并观察文件路径的哪些部分对分类器分数变化贡献最大。我们发现模型学到了文件路径中对分类有用的方面,同时也学到了客户测试厂商产品的伪迹,例如通过下载以哈希命名的恶意软件样本目录。我们从测试数据集中剪除这些伪迹,并展示在 假阳性率(FPR)下假阴性率降低 32.3%,在 FPR 下降低 33.1%,优于仅以相似拓扑单输入 PE 文件内容的模型。
引用
@article{arxiv.1905.06987,
title = {Learning from Context: Exploiting and Interpreting File Path Information for Better Malware Detection},
author = {Adarsh Kyadige and Ethan M. Rudd and Konstantin Berlin},
journal= {arXiv preprint arXiv:1905.06987},
year = {2019}
}
备注
Submitted to ACM CCS 2019