中文

约束域中的对抗样本

密码学与安全 2022-09-12 v3 机器学习

摘要

机器学习算法已被证明在图像识别等领域中易因对输入进行系统性修改(如对抗样本)而受到对抗性操纵。在默认威胁模型下,对手利用图像的无约束特性;每个特征(像素)完全受对手控制。然而,这些攻击如何转化到限制对手可修改哪些及如何修改特征的约束域(如网络入侵检测)尚不清楚。本文中,我们探究约束域是否比无约束域更不易受对抗样本生成算法攻击。我们创建了一种生成对抗草图的算法:在有界域约束包络内编码特征显著性的定向通用扰动向量。为评估这些算法的表现,我们在约束域(如网络入侵检测)与无约束域(如图像识别)中对其评估。结果表明,我们的方法在约束域中产生的误分类率与无约束域相当(大于 95%)。我们的调查表明,约束域暴露的狭窄攻击面仍足够大以构造成功的对抗样本;因此,约束似乎并不能使一个域变得鲁棒。事实上,仅用五个随机选取的特征,仍可再生对抗样本。

关键词

引用

@article{arxiv.2011.01183,
  title  = {Adversarial Examples in Constrained Domains},
  author = {Ryan Sheatsley and Nicolas Papernot and Michael Weisman and Gunjan Verma and Patrick McDaniel},
  journal= {arXiv preprint arXiv:2011.01183},
  year   = {2022}
}

备注

Accepted to IOS Press Journal of Computer Security