中文

结构保持变换:生成多样且可迁移的对抗样本

机器学习 2018-12-27 v3 人工智能 密码学与安全 计算机视觉与模式识别 机器学习

摘要

对抗样本是为欺骗机器学习模型而设计的扰动输入。近期大多数关于图像分类对抗样本的工作集中于以微小扰动直接修改像素。这些工作的一个共同要求是恶意扰动应足够小(以某 p 的 L_p 范数度量),从而使人无法察觉。然而,小扰动可能过于受限,并限制了所生成对抗样本的多样性。此外,基于 L_p 范数的距离度量忽略了图像中对人类感知至关重要的隐藏结构模式。因此,即便近期工作中引入的微小扰动也常使对抗样本对人类而言不够自然。更重要的是,它们通常迁移性不佳,因而在攻击黑盒模型时效果较差,尤其对那些受防御机制保护的模型。本文提出一种结构保持变换(SPT)以生成极其高迁移性的自然且多样的对抗样本。我们方法的核心思想是允许对抗样本中存在可感知偏差,同时保留对人类分类器至关重要的结构模式。在 MNIST 与 fashion-MNIST 数据集上的实证结果表明,我们的方法生成的对抗样本可轻易绕过强对抗训练。此外,它们能很好地迁移到其他目标模型,且攻击成功率无损失或仅有微小损失。

关键词

引用

@article{arxiv.1809.02786,
  title  = {Structure-Preserving Transformation: Generating Diverse and Transferable Adversarial Examples},
  author = {Dan Peng and Zizhan Zheng and Xiaofeng Zhang},
  journal= {arXiv preprint arXiv:1809.02786},
  year   = {2018}
}

备注

The AAAI-2019 Workshop on Artificial Intelligence for Cyber Security (AICS)