通过基于梯度的模型剪枝遗忘后门攻击
机器学习
2024-05-08 v1 密码学与安全
摘要
在网络安全威胁日益受到关注的时代,防御后门攻击对于确保机器学习模型的完整性和可靠性至关重要。然而,许多现有方法需要大量数据才能有效缓解,这在实际部署中带来了重大挑战。为了解决这个问题,我们提出了一种新颖的方法,通过将后门攻击的缓解视为一个遗忘任务来对抗后门攻击。我们通过一种有针对性的模型剪枝策略来应对这一挑战,利用遗忘损失梯度来识别和消除模型中的后门元素。基于坚实的理论见解,我们的方法简单而有效,使其非常适合数据有限的场景。我们的方法包括制定合适的遗忘损失,并设计一种针对卷积神经网络的模型剪枝技术。全面的评估表明,与最先进的方法相比,我们提出的方法在现实数据设置中尤其有效。
引用
@article{arxiv.2405.03918,
title = {Unlearning Backdoor Attacks through Gradient-Based Model Pruning},
author = {Kealan Dunnett and Reza Arablouei and Dimity Miller and Volkan Dedeoglu and Raja Jurdak},
journal= {arXiv preprint arXiv:2405.03918},
year = {2024}
}