基于遗忘权重变化与后门活性的后门漏洞解析与缓解
密码学与安全
2024-05-31 v1 计算机视觉与模式识别
机器学习
摘要
后门攻击是深度神经网络(DNN)面临的核心安全威胁。最近的研究表明,在无毒数据的情况下,通过干净数据进行模型遗忘然后学习剪枝掩码,有助于后门防御。此外,干净数据的常规微调可帮助恢复丢失的干净准确率。然而,干净遗忘的行为仍未得到充分探索,而常规微调不慎会重新引入后门效应。本文首先从权重变化和梯度范数角度 investigate 模型遗忘,发现两个有趣的观察:1) 毒药遗忘与干净遗忘之间的权重变化呈正相关,这使得我们无需使用毒药数据即可识别与后门相关的神经元;2) 后门模型的神经元比干净模型更活跃(即梯度范数变化更大),这表明在微调期间需要抑制梯度范数。随后,我们提出一种有效的两阶段防御方法。第一阶段,基于观察1,提出一种基于神经元权重变化(NWC)的高效后门重新初始化方法。第二阶段,基于观察2,设计一种基于活性的微调方法以取代常规微调。广泛的实验(涉及八种后门攻击及三个基准数据集)表明,我们的方法在多个最新SOTA后门防御方法中表现出优异性能。
引用
@article{arxiv.2405.20291,
title = {Unveiling and Mitigating Backdoor Vulnerabilities based on Unlearning Weight Changes and Backdoor Activeness},
author = {Weilin Lin and Li Liu and Shaokui Wei and Jianze Li and Hui Xiong},
journal= {arXiv preprint arXiv:2405.20291},
year = {2024}
}