通过有意对抗扰动检测深度神经网络中的后门
计算机视觉与模式识别
2023-05-26 v2 人工智能
摘要
近期研究表明深度学习模型易受后门攻击。许多针对后门攻击的防御已被提出。然而,现有防御工作需较高计算开销或后门攻击信息(如触发器大小),难以在现实场景中满足。本文提出一种基于对抗样本的新的后门检测方法。所提方法利用有意对抗扰动来检测图像是否含有触发器,可应用于训练阶段和推理阶段(在训练阶段清洗训练集,在推理阶段检测后门实例)。具体而言,给定一张不可信图像,有意地向该图像添加对抗扰动。若模型在扰动图像上的预测与在未扰动图像上一致,则该输入图像将被视为后门实例。与多数现有防御工作相比,所提基于对抗扰动的方法所需计算资源低,并保持图像的视觉质量。实验结果表明,所提防御方法在 Fashion-MNIST、CIFAR-10 和 GTSRB 数据集上的后门检测率分别为 99.63%、99.76% 和 99.91%。此外,所提方法保持图像视觉质量,因为在 Fashion-MNIST、CIFAR-10 和 GTSRB 数据集上所添加扰动的 l2 范数分别低至 2.8715、3.0513 和 2.4362。另外,还证明所提方法在不同攻击设置(触发器透明度、触发器大小和触发器模式)下对后门攻击均能实现高防御性能。与现有防御工作(STRIP)相比,所提方法在全部三个数据集上检测性能更优,且比 STRIP 更高效。
引用
@article{arxiv.2105.14259,
title = {Detecting Backdoor in Deep Neural Networks via Intentional Adversarial Perturbations},
author = {Mingfu Xue and Yinghao Wu and Zhiyu Wu and Yushu Zhang and Jian Wang and Weiqiang Liu},
journal= {arXiv preprint arXiv:2105.14259},
year = {2023}
}