中文

感知对抗鲁棒性:防御未见威胁模型

机器学习 2021-07-06 v4 计算机视觉与模式识别 机器学习

摘要

对抗鲁棒性中的一个关键挑战是缺乏对人类感知的精确数学刻画,而人类感知正被用于定义人眼不可感知的对抗攻击。当前大多数攻击与防御试图通过考虑受限的对抗威胁模型来规避此问题,例如由 L2L_2LL_\infty 距离、空间扰动等所界定的模型。然而,针对这些任一受限威胁模型鲁棒的模型在其他威胁模型下仍然脆弱。为解决该问题,我们提出针对所有不可感知对抗样本集合的对抗训练,使用深度神经网络进行近似。我们称此威胁模型为神经感知威胁模型(NPTM);它包含与自然图像具有有界神经感知距离(真实感知距离基于神经网络的近似)的对抗样本。通过广泛的感知研究,我们表明神经感知距离与人类对对抗样本可感知性的判断良好相关,从而验证我们的威胁模型。在 NPTM 下,我们开发了新颖的感知对抗攻击与防御。由于 NPTM 非常宽泛,我们发现针对某一感知攻击的感知对抗训练(PAT)可给出对许多其他类型对抗攻击的鲁棒性。我们在 CIFAR-10 与 ImageNet-100 上针对五种多样的对抗攻击测试 PAT。我们发现 PAT 在这五种攻击的并集上取得了最先进的(state-of-the-art)鲁棒性,相较次优模型将准确率提升一倍以上,且未针对其中任何一种进行训练。即,PAT 对未预见的扰动类型泛化良好。这在无法假定特定威胁模型的敏感应用中至关重要,且据我们所知,PAT 是首个具有此性质的对抗训练防御。

关键词

引用

@article{arxiv.2006.12655,
  title  = {Perceptual Adversarial Robustness: Defense Against Unseen Threat Models},
  author = {Cassidy Laidlaw and Sahil Singla and Soheil Feizi},
  journal= {arXiv preprint arXiv:2006.12655},
  year   = {2021}
}

备注

Published in ICLR 2021. Code and data are available at https://github.com/cassidylaidlaw/perceptual-advex