对抗攻击可通过自然监督实现逆转
计算机视觉与模式识别
2021-09-10 v3 密码学与安全
机器学习
摘要
我们发现图像包含内在结构,能够实现对多种对抗攻击的逆转。攻击向量不仅导致图像分类器失效,还附带地破坏了图像中偶然的结构。我们证明,修改被攻击图像以恢复自然结构将逆转多种类型的攻击,从而提供一种防御。实验表明,在 CIFAR-10、CIFAR-100、SVHN 和 ImageNet 数据集上,多种最先进模型的鲁棒性得到显著提升。我们的结果显示,即便攻击者知晓防御机制,我们的防御依然有效。由于我们的防御部署在推理阶段而非训练阶段,因此与预训练网络以及大多数其他防御兼容。我们的结果表明,深度网络易受对抗样本攻击,部分原因在于其表示未强制施加图像的自然结构。
引用
@article{arxiv.2103.14222,
title = {Adversarial Attacks are Reversible with Natural Supervision},
author = {Chengzhi Mao and Mia Chiquier and Hao Wang and Junfeng Yang and Carl Vondrick},
journal= {arXiv preprint arXiv:2103.14222},
year = {2021}
}