中文

利用隐式神经表示阻碍对抗攻击

机器学习 2022-10-26 v1 密码学与安全

摘要

我们提出了有损隐式网络激活编码(LINAC)防御,这是一种输入变换方法,能够成功阻碍针对 CIFAR-1010 分类器的若干常见对抗攻击,在 LL_\infty 范数下扰动上界达 ϵ=8/255\epsilon = 8/255、在 L2L_2 范数下达 ϵ=0.5\epsilon = 0.5。该方法利用隐式神经表示对 2D2\text{D} 图像中的像素颜色强度进行近似编码,使得在变换数据上训练的分类器无需对抗训练或大幅性能下降即表现出对小扰动的鲁棒性。用于初始化和训练隐式神经表示的随机数生成器种子被证明是更强通用攻击所需的必要信息,暗示其作为私钥的作用。我们设计了一种针对基于密钥防御的参数旁路近似(PBA)攻击策略,成功使该类中的一种现有方法失效。有趣的是,我们的 LINAC 防御也阻碍了一些迁移攻击与自适应攻击,包括我们提出的新型 PBA 策略。我们的结果强调了尽管在标准评估下看似鲁棒,仍需要广泛定制攻击的重要性。本投稿中所评估的受防御分类器的 LINAC 源代码与参数已公开:https://github.com/deepmind/linac

关键词

引用

@article{arxiv.2210.13982,
  title  = {Hindering Adversarial Attacks with Implicit Neural Representations},
  author = {Andrei A. Rusu and Dan A. Calian and Sven Gowal and Raia Hadsell},
  journal= {arXiv preprint arXiv:2210.13982},
  year   = {2022}
}