对偶流形对抗鲁棒性:防御 Lp 与非 Lp 对抗攻击
计算机视觉与模式识别
2020-09-08 v1
摘要
对抗训练是针对具有有界 Lp 范数攻击威胁模型的流行防御策略。然而,它常使模型在正常图像上的性能下降,且防御对新攻击的泛化性不佳。鉴于 GAN 与 VAE 等深度生成模型在刻画图像底层流形方面的成功,我们探究前述问题能否通过利用底层流形信息得以缓解。为此,我们通过将 ImageNet 样本投影到 StyleGSN 所学流形上,构建了“流形上 ImageNet”(OM-ImageNet)数据集。对于该数据集,底层流形信息是精确的。利用 OM-ImageNet,我们首先表明在图像潜空间中进行对抗训练可提升标准准确率及对流形上攻击的鲁棒性。然而,由于未实现流形外扰动,该防御可被 Lp 对抗攻击攻破。我们进一步提出对偶流形对抗训练(DMAT),其同时在潜空间与图像空间中使用对抗扰动以增强模型鲁棒性。我们的 DMAT 提升了正常图像上的性能,并针对 Lp 攻击取得了与标准对抗训练相当的鲁棒性。此外,我们观察到经 DMAT 防御的模型对通过全局色彩偏移或各类图像滤波操纵图像的新攻击具有改善的鲁棒性。有趣的是,当防御模型在流形外自然图像上测试时,亦取得类似改进。这些结果展示了利用流形信息增强深度学习模型针对各类新对抗攻击鲁棒性的潜在益处。
引用
@article{arxiv.2009.02470,
title = {Dual Manifold Adversarial Robustness: Defense against Lp and non-Lp Adversarial Attacks},
author = {Wei-An Lin and Chun Pong Lau and Alexander Levine and Rama Chellappa and Soheil Feizi},
journal= {arXiv preprint arXiv:2009.02470},
year = {2020}
}