中文

信息掩蔽的对抗净化

计算机视觉与模式识别 2023-11-28 v1 密码学与安全 机器学习 图像与视频处理

摘要

对抗攻击精心生成微小、难以察觉的图像扰动以欺骗神经网络。作为对抗,对抗净化方法试图将对抗输入样本转换为干净的输出图像以防御对抗攻击。然而,现有的生成模型未能有效消除对抗扰动,导致不尽理想的净化结果。我们强调残存对抗扰动对目标模型的潜在威胁,定量建立了扰动尺度与攻击能力之间的关系。值得注意的是,净化图像上的残存扰动主要源自对抗样本的同位块与相似块。我们提出了一种名为信息掩蔽净化(Information Mask Purification,IMPure)的新型对抗净化方法,旨在广泛消除对抗扰动。为获得对抗样本,我们首先掩蔽部分块信息,然后重构这些块以抵抗来自块的对抗扰动。我们并行重构所有块以获得连贯图像。接着,为保护净化样本免受潜在相似区域扰动,我们在将净化样本输入特征提取网络之前,通过将净化样本与输入样本随机混合来模拟此风险。最后,我们建立像素损失与感知损失的组合约束以增强模型的重构适应性。在 ImageNet 数据集上对三种分类器模型的大量实验表明,我们的方法针对九种对抗攻击方法取得了最先进的结果。实现代码与预训练权重可在 https://github.com/NoWindButRain/IMPure 获取。

关键词

引用

@article{arxiv.2311.15339,
  title  = {Adversarial Purification of Information Masking},
  author = {Sitong Liu and Zhichao Lian and Shuangquan Zhang and Liang Xiao},
  journal= {arXiv preprint arXiv:2311.15339},
  year   = {2023}
}