中文

面向恶意软件的可实现通用对抗扰动

密码学与安全 2022-02-03 v2 人工智能

摘要

机器学习分类器易受对抗样本——即操纵模型输入的特定输入扰动——的攻击。通用对抗扰动(UAPs)可识别在输入空间中具有泛化性的噪声模式,使攻击者能够大幅扩展此类样本的生成规模。尽管 UAPs 已在计算机视觉以外的应用领域中被探索,但其在可实现攻击(如恶意软件)这一特定背景下的性质与影响仍鲜为人知,此类攻击中攻击者必须满足具有挑战性的问题空间约束。本文探讨恶意软件分类背景下 UAPs 的挑战与优势。我们生成问题空间变换序列,在相应特征空间嵌入中诱导出 UAPs,并评估其在不同恶意软件域中的有效性。此外,我们利用从问题空间变换中获得的知识提出基于对抗训练的缓解方法,并与替代性特征空间防御进行比较。我们的实验将白盒 Android 规避攻击的有效性限制在约 20%,代价是在 1% FPR 下损失约 3% TPR。我们还展示了如何将我们的方法适配到如 Windows 恶意软件等更具限制性的域。我们观察到,尽管特征空间中的对抗训练必须应对庞大且常无约束的区域,问题空间中的 UAPs 能识别特定漏洞,使我们更有效地加固分类器,从而将识别新通用对抗变换的挑战与相关成本重新转嫁给攻击者。

关键词

引用

@article{arxiv.2102.06747,
  title  = {Realizable Universal Adversarial Perturbations for Malware},
  author = {Raphael Labaca-Castro and Luis Muñoz-González and Feargus Pendlebury and Gabi Dreo Rodosek and Fabio Pierazzi and Lorenzo Cavallaro},
  journal= {arXiv preprint arXiv:2102.06747},
  year   = {2022}
}

备注

19 pages, 10 figures