通过抑制模型捷径进行后门防御
计算机视觉与模式识别
2023-03-07 v2 密码学与安全
机器学习
摘要
最近的研究表明,深度神经网络(DNN)在训练过程中容易受到后门攻击。具体而言,攻击者意图在 DNN 中嵌入隐藏的后门,从而可以通过预定义的触发模式激活恶意的模型预测。在本文中,我们从模型结构的角度探讨后门机制。受跳连接有助于模型学习“捷径”且后门触发通常更容易在其中被学习这一理解的启发,我们选择跳连接进行讨论。具体而言,我们证明了当减少某些关键跳连接的输出时,攻击成功率(ASR)会显著下降。基于这一观察,我们设计了一种简单而有效的后门移除方法,通过抑制我们方法所选定的关键层中的跳连接来实现。我们还在这些层上实施微调,以恢复高良性准确率并进一步降低 ASR。在基准数据集上的大量实验验证了我们方法的有效性。
引用
@article{arxiv.2211.05631,
title = {Backdoor Defense via Suppressing Model Shortcuts},
author = {Sheng Yang and Yiming Li and Yong Jiang and Shu-Tao Xia},
journal= {arXiv preprint arXiv:2211.05631},
year = {2023}
}
备注
This paper is accepted by ICASSP 2023. 5 pages