中文

面向后门与对抗攻击的统一鲁棒性

计算机视觉与模式识别 2024-05-29 v1

摘要

深度神经网络 (DNN) 已知对后门与对抗攻击均高度脆弱。在文献中,这两种攻击通常被视为独立的鲁棒性问题,分别进行解决,因为前者属于训练时攻击,后者属于推理时攻击。然而,本文揭示了二者之间存在惊人联系:(1) 将后门植入模型会显著影响模型的对抗样本;(2) 对于感染模型,其对抗样本与触发图像具有相似特征。基于上述观察,我们提出了一种新型渐进式统一防御算法 (PUD),以同时防御后门与对抗攻击。具体而言,PUD 包含渐进式模型净化方案,联合擦除后门并提升模型对对抗攻击的鲁棒性。在早期阶段,利用感染模型的对抗样本来擦除后门;随着后门逐渐被清除,模型净化自然过渡到提升对抗鲁棒性的阶段。此外,我们的 PUD 算法能够有效识别被投毒图像,从而无需初始数据集完全干净。大量实验表明,我们发现的所有后门与对抗攻击之间的联系具有普遍性,适用于各种后门攻击类型。我们的方法优于当前最先进的后门防御技术,包括基于模型修复和数据过滤的方法;同时也能与最先进的对抗防御方法相抗衡。

关键词

引用

@article{arxiv.2405.17929,
  title  = {Towards Unified Robustness Against Both Backdoor and Adversarial Attacks},
  author = {Zhenxing Niu and Yuyao Sun and Qiguang Miao and Rong Jin and Gang Hua},
  journal= {arXiv preprint arXiv:2405.17929},
  year   = {2024}
}