防御深度神经网络的后门攻击
密码学与安全
2025-03-27 v3 机器学习
摘要
尽管深度神经网络(DNNs)在各种计算机视觉任务中取得了巨大成功,但近期发现它们易受对抗攻击。本文关注所谓的后门攻击(backdoor attack),其向一小部分训练数据(亦称数据投毒)中注入后门触发器,使得训练后的 DNN 在面临带此触发器的样本时导致误分类。具体而言,我们通过 Grad-CAM 仔细研究了真实与合成后门攻击对普通与后门 DNN 内部响应的影响。此外,我们表明,相较于激活图的 与 范数,后门攻击在 范数意义上引发了神经元激活的显著偏置。受结果启发,我们提出基于 的神经元剪枝(-based neuron pruning)以从后门 DNN 中移除后门。实验表明,我们的方法能有效降低攻击成功率,并对干净图像保持较高分类准确率。
引用
@article{arxiv.2002.12162,
title = {Defending against Backdoor Attack on Deep Neural Networks},
author = {Hao Cheng and Kaidi Xu and Sijia Liu and Pin-Yu Chen and Pu Zhao and Xue Lin},
journal= {arXiv preprint arXiv:2002.12162},
year = {2025}
}
备注
This workshop manuscript is not a publication and will not be published anywhere