通过表征解耦实现对抗净化
计算机视觉与模式识别
2021-10-18 v1 机器学习
摘要
深度学习模型易受对抗样本攻击并产生难以理解的错误,这对其实际部署构成威胁。结合对抗训练的思想,基于预处理的防御因其任务独立性和良好的泛化能力而广受欢迎且使用便捷。当前的防御方法,尤其是净化方法,倾向于通过学习并恢复自然图像来去除“噪声”。然而,与随机噪声不同,对抗模式由于与图像强相关,在模型训练过程中更容易被过拟合。本文提出一种新颖的对抗净化方案,将自然图像与对抗扰动的解耦作为一种预处理防御。大量实验表明,我们的防御具有良好的泛化能力,并能对未见过的强对抗攻击提供显著保护。它将当前最先进的**集成**攻击的平均成功率从 **61.7%** 降至 **14.9%**,优于多种现有方法。值得注意的是,我们的防御完美地恢复了被扰动的图像,且不损害骨干模型的干净准确率,这在实际应用中非常理想。
引用
@article{arxiv.2110.07801,
title = {Adversarial Purification through Representation Disentanglement},
author = {Tao Bai and Jun Zhao and Lanqing Guo and Bihan Wen},
journal= {arXiv preprint arXiv:2110.07801},
year = {2021}
}