中文

受害者与受益者:利用被毒化模型在毒化数据上训练干净模型

计算机视觉与模式识别 2024-06-03 v2

摘要

最近,后门攻击对深度神经网络(DNN)的训练过程构成了严重的安全威胁。攻击后的模型在良性样本上表现正常,但在触发器存在时输出特定结果。然而,与后门攻击的快速进展相比,现有防御措施要么难以有效应对这些威胁,要么需要良性样本才能工作,这在实际场景中可能不可得。在本文中,我们发现毒化样本与良性样本可以通过预测熵进行区分。这启发我们提出一种新颖的双网络训练框架:受害者与受益者(V&B),该框架无需额外的良性样本,利用被毒化模型在毒化数据上训练干净模型。首先,我们牺牲受害者网络,通过在可疑样本上训练来成为强大的毒化样本检测器。其次,我们在受害者选中可信样本上训练受益者网络,以抑制后门注入。最后,采用半监督抑制策略以擦除潜在后门并提高模型性能。此外,为了更好地抑制遗漏的毒化样本,我们提出了一种强数据增强方法AttentionMix,该方法与我们提出的V&B框架效果良好。在两个广泛使用的数据集上针对6种最先进的攻击进行大量实验,表明我们的框架在防止后门注入方面有效且对各种攻击都稳健,同时保持了对良性样本的性能。我们的代码可在 https://github.com/Zixuan-Zhu/VaB 查看。

关键词

引用

@article{arxiv.2404.11265,
  title  = {The Victim and The Beneficiary: Exploiting a Poisoned Model to Train a Clean Model on Poisoned Data},
  author = {Zixuan Zhu and Rui Wang and Cong Zou and Lihua Jing},
  journal= {arXiv preprint arXiv:2404.11265},
  year   = {2024}
}

备注

13 pages, 6 figures, published to ICCV