中文

基于离散像素扰动的不可感知后门触发器用于图像分类器模型

计算机视觉与模式识别 2022-08-22 v1 人工智能

摘要

典型的深度神经网络(DNN)后门攻击基于嵌入于输入中的触发器。现有不可感知触发器计算成本高或攻击成功率低。本文提出一种新型后门触发器,其易于生成、不可感知且高度有效。该新触发器为均匀随机生成的三维(3D)二值模式,可水平及/或垂直重复与镜像,并叠加到三通道图像上以训练带后门的 DNN 模型。新触发器离散分布于图像中,对单个像素产生微弱扰动,但整体呈现强可识别模式以训练和激活 DNN 的后门。我们还解析揭示该触发器随图像分辨率提高而愈发有效。实验使用 ResNet-18 和 MLP 模型在 MNIST、CIFAR-10 和 BTSR 数据集上进行。在不可感知性方面,新触发器以超过一个数量级优于现有触发器,如 BadNets、Trojaned NN 和 Hidden Backdoor。新触发器实现了近乎 100% 的攻击成功率,仅使分类精度降低不到 0.7%-2.4%,并使最先进的防御技术失效。

关键词

引用

@article{arxiv.2208.09336,
  title  = {Dispersed Pixel Perturbation-based Imperceptible Backdoor Trigger for Image Classifier Models},
  author = {Yulong Wang and Minghui Zhao and Shenghong Li and Xin Yuan and Wei Ni},
  journal= {arXiv preprint arXiv:2208.09336},
  year   = {2022}
}