中文

面向恶意软件分类的多示例学习

密码学与安全 2017-05-08 v1

摘要

本工作通过使用多示例学习范式中的基于词汇的方法,对沙箱中执行的未知二进制文件进行分类,建模其与系统资源(文件、互斥体、注册表项以及通过网络与服务器的通信)的交互以及操作系统提供的错误消息。它引入了适用于各资源类型的相似性度量,结合近似聚类方法高效地对系统资源分组并直接从数据定义特征。该方法有效去除了恶意软件作者常采用的随机化,并将样本投影到适用于常见分类器的低维特征空间。在大型二进制语料库上与现有最佳方法的广泛比较表明,所提方案仅使用一小部分训练样本即取得更优结果。此外,它利用了与大多数先前技术不同的信息源,增加了检测恶意软件的工具多样性,从而使检测规避更加困难。

关键词

引用

@article{arxiv.1705.02268,
  title  = {Multiple Instance Learning for Malware Classification},
  author = {Jan Stiborek and Tomáš Pevný and Martin Rehák},
  journal= {arXiv preprint arXiv:1705.02268},
  year   = {2017}
}