中文

针对恶意软件分类中深度神经网络的对抗性扰动

密码学与安全 2016-06-17 v2 机器学习 神经与进化计算

摘要

深度神经网络与许多其他机器学习模型一样,最近被证明缺乏针对对抗性构造输入的鲁棒性。这些输入源自常规输入,通过微小但精心选择的扰动,诱使机器学习模型产生期望的错误分类。这一新兴领域的现有工作主要针对图像分类领域,因为图像的高熵特性可以被方便地利用,而不改变图像的整体视觉外观。然而,此类攻击如何转化为恶意软件检测等对安全性更敏感的应用仍不明确——这在样本生成方面可能带来重大挑战,且失败的后果可能相当严重。在本文中,我们展示了如何为用作恶意软件分类器的神经网络构造高效的对抗样本构造攻击。与计算机视觉领域相比,恶意软件分类的应用领域在对抗样本构造问题中引入了额外的约束:(i) 连续、可微的输入域被离散的、通常是二元的输入所取代;以及 (ii) 保持视觉外观不变这一宽松条件被要求具有等效的功能行为所取代。我们在使用 DREBIN Android 恶意软件数据集训练的许多不同恶意软件分类器实例上展示了这些攻击的可行性。我们进一步评估了针对对抗性构造的潜在防御机制在多大程度上可以应用于恶意软件分类的设置。虽然特征缩减未表现出积极影响,但蒸馏和在对抗性构造样本上重新训练显示出了有希望的结果。

关键词

引用

@article{arxiv.1606.04435,
  title  = {Adversarial Perturbations Against Deep Neural Networks for Malware Classification},
  author = {Kathrin Grosse and Nicolas Papernot and Praveen Manoharan and Michael Backes and Patrick McDaniel},
  journal= {arXiv preprint arXiv:1606.04435},
  year   = {2016}
}

备注

version update: correcting typos, incorporating external feedback