中文

TnT攻击!针对深度神经网络系统的通用自然对抗补丁

计算机视觉与模式识别 2022-07-27 v2 密码学与安全

摘要

深度神经网络易受对抗性输入攻击,且近来还面临木马攻击以误导或劫持模型决策。我们通过探索生成对抗网络内空间有界对抗样本空间与自然输入空间的超集,揭示了存在一类引人注目的空间有界、物理可实现的对抗样本——通用自然对抗补丁(Universal NaTuralistic adversarial paTches)——我们称之为TnT。现在,攻击者可以装备一个自然、看似无害、物理可实现、高效(达到高攻击成功率)且通用的补丁。TnT是通用的,因为场景中捕获的任何含TnT的输入图像都将:i)误导网络(无目标攻击);或ii)迫使网络做出恶意决策(有目标攻击)。有趣的是,对抗补丁攻击者现在有可能施加更高程度的控制——能够选择位置无关、自然外观的补丁作为触发器,而非受限于噪声扰动——这一能力此前仅被认为可能通过木马攻击方法实现(需干扰模型构建过程以嵌入后门,但有被发现风险);但仍可实现物理世界中可部署的补丁。通过对大规模视觉分类任务ImageNet及其全部5万张验证集图像的评估,我们展示了TnT的现实威胁和攻击鲁棒性。我们展示了该攻击的泛化性,可创建比现有最先进(SOTA)方法攻击成功率更高的补丁。我们的结果表明该攻击可泛化至不同视觉分类任务(CIFAR-10、GTSRB、PubFig)和多个SOTA深度神经网络如WideResnet50、Inception-V3和VGG-16。

关键词

引用

@article{arxiv.2111.09999,
  title  = {TnT Attacks! Universal Naturalistic Adversarial Patches Against Deep Neural Network Systems},
  author = {Bao Gia Doan and Minhui Xue and Shiqing Ma and Ehsan Abbasnejad and Damith C. Ranasinghe},
  journal= {arXiv preprint arXiv:2111.09999},
  year   = {2022}
}

备注

Accepted for publication in the IEEE Transactions on Information Forensics & Security (TIFS)