先暴露后防御:通过暴露模型统一并增强后门防御
人工智能
2024-10-28 v1
摘要
后门攻击通过用预先设计的后门触发器毒化一小部分训练数据,将触发器隐蔽地植入深度神经网络(DNNs)。在大模型时代,这一漏洞进一步加剧,因为在网络抓取数据集上进行的大规模(预)训练极易受到攻击危害。本文提出了一种名为“先暴露后防御”的新型两步防御框架。EBYD 将现有的后门防御方法统一为一个性能增强的综合防御系统。具体而言,EBYD 首先通过称为后门暴露的模型预处理步骤暴露后门模型中的后门功能,随后对暴露后的模型应用检测和移除方法以识别并消除后门特征。在后门暴露的第一步中,我们提出了一种称为 Clean Unlearning (CUL) 的新技术,该技术主动从后门模型中遗忘干净特征以揭示隐藏的后门特征。我们还探索了用于后门暴露的各种模型编辑/修改技术,包括微调、模型稀疏化和权重扰动。使用 EBYD,我们在 2 个视觉数据集(CIFAR-10 和一个 ImageNet 子集)与 4 个语言数据集(SST-2、IMDB、Twitter 和 AG's News)上对 10 种图像攻击和 6 种文本攻击进行了广泛实验。结果证明了后门暴露对后门防御的重要性,表明暴露后的模型能显著使一系列下游防御任务受益,包括后门标签检测、后门触发器恢复、后门模型检测和后门移除。我们希望这项工作能激发更多关于利用暴露模型开发先进防御框架的研究。代码发布于:https://github.com/bboylyg/Expose-Before-You-Defend。
引用
@article{arxiv.2410.19427,
title = {Expose Before You Defend: Unifying and Enhancing Backdoor Defenses via Exposed Models},
author = {Yige Li and Hanxun Huang and Jiaming Zhang and Xingjun Ma and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2410.19427},
year = {2024}
}
备注
19 pages