中文

Marvolo:面向实用机器学习驱动恶意软件检测的程序化数据增强

密码学与安全 2022-06-08 v1 机器学习

摘要

由于难以以与原始数据语义一致的方式改变数据,数据增强在网络安全领域一直较为罕见。鉴于获取受版权限制的训练用良性与恶意数据本身存在独特困难,且银行和政府等机构收到的定向恶意软件永远不会大量存在,这一短板尤为棘手。我们提出 MARVOLO,一种二进制变异器,它以程序化方式扩充恶意(及良性)数据集,从而提升机器学习驱动恶意软件检测器的准确率。MARVOLO 采用保留语义的代码变换,模拟恶意软件作者和防御性良性开发者在实践中常规进行的改动,使我们能够生成有意义的增强数据。关键在于,保留语义的变换还使 MARVOLO 能够安全地将标签从原始数据样本传播到新生成的数据样本,而无需对二进制文件进行昂贵的逆向工程。此外,MARVOLO 嵌入了若干关键优化,通过在给定时间(或资源)预算内最大化所生成多样化数据样本的密度,为从业者保持低成本。使用广泛的商业恶意软件数据集和近期机器学习驱动恶意软件检测器的实验表明,MARVOLO 仅以潜在输入二进制的很小一部分(15%)运行,便将准确率提升了高达 5%。

关键词

引用

@article{arxiv.2206.03265,
  title  = {Marvolo: Programmatic Data Augmentation for Practical ML-Driven Malware Detection},
  author = {Michael D. Wong and Edward Raff and James Holt and Ravi Netravali},
  journal= {arXiv preprint arXiv:2206.03265},
  year   = {2022}
}

备注

15 pages, 7 figures