面向后门的对抗性特征图剪枝
机器学习
2024-02-26 v2 软件工程
摘要
深度神经网络已广泛应用于许多关键应用,如自动驾驶和医学诊断。然而,其安全性受到后门攻击的威胁,后门攻击通过向特定训练数据添加人工模式来实现。现有的防御策略主要侧重于使用逆向工程来复现攻击者生成的后门触发器,随后通过将触发器加入输入并利用真实标签微调模型来修复 DNN 模型。然而,一旦攻击者生成的触发器复杂且不可见,防御者便无法成功复现触发器,从而模型不会被修复,因为触发器未被有效移除。在这项工作中,我们提出面向后门的对抗性特征图剪枝(FMP)以缓解 DNN 中的后门。与侧重于复现后门触发器的现有防御策略不同,FMP 试图剪枝后门特征图,这些特征图被训练用于从输入中提取后门信息。剪枝这些后门特征图后,FMP 将使用训练数据的安全子集对模型进行微调。我们的实验表明,与现有防御策略相比,FMP 能有效降低攻击成功率(ASR),即便面对最复杂和不可见的攻击触发器(例如,在 CIFAR10 中 FMP 将 ASR 降至 2.86%,比基线低 19.2% 至 65.41%)。其次,与倾向于表现出低鲁棒准确率(即模型在中毒数据上的准确率)的传统防御方法不同,FMP 实现了更高的 RA,表明其在缓解后门攻击影响的同时保持模型性能方面具有优越性(例如,FMP 在 CIFAR10 中获得 87.40% 的 RA)。我们的代码公开于:https://github.com/retsuh-bqw/FMP。
引用
@article{arxiv.2307.11565,
title = {Adversarial Feature Map Pruning for Backdoor},
author = {Dong Huang and Qingwen Bu},
journal= {arXiv preprint arXiv:2307.11565},
year = {2024}
}
备注
Accepted to ICLR 2024