通过连接后门与对抗攻击的渐进式后门擦除
计算机视觉与模式识别
2022-12-29 v4
摘要
深度神经网络(DNNs)已知易受后门攻击和对抗攻击。文献中,这两类攻击通常被视为不同问题并分开解决,因为它们分别属于训练时和推理时攻击。然而,本文中我们发现了它们之间的一个有趣联系:对于植入后门的模型,我们观察到其对抗样本与触发图像行为相似,即均激活相同的DNN神经元子集。这表明向模型植入后门会显著影响模型的对抗样本。基于这些观察,提出一种新颖的渐进式后门擦除(PBE)算法,通过利用无目标对抗攻击逐步净化受感染模型。与以往后门防御方法不同,我们方法的一个显著优势是即使干净额外数据集不可用时也能擦除后门。我们经实验表明,针对5种最先进的后门攻击,我们的PBE能有效擦除后门,且在干净样本上无明显性能下降,并显著优于现有防御方法。
引用
@article{arxiv.2202.06312,
title = {Progressive Backdoor Erasing via connecting Backdoor and Adversarial Attacks},
author = {Bingxu Mu and Zhenxing Niu and Le Wang and Xue Wang and Rong Jin and Gang Hua},
journal= {arXiv preprint arXiv:2202.06312},
year = {2022}
}