中文

基于费雪信息引导的后门攻击净化方法

计算机视觉与模式识别 2024-09-04 v1

摘要

近年来对后门攻击的研究表明,攻击者可以通过操纵少量训练样本来破坏深度神经网络(DNN)的完整性。我们的分析显示,这种操纵会使后门模型收敛到一个坏的局部极小值,即与良性模型相比更尖锐的极小值。直观上,可以通过将模型重新优化到更平滑的极小值来净化后门。然而,简单地采用任何针对更平滑极小值的优化都可能导致次优的净化技术,从而损害干净样本的测试精度。因此,为了有效地实现这种重新优化,受我们提出的将后门移除与损失平滑度联系起来的新视角启发,我们提出了费雪信息引导净化(FIP),一种新颖的后门净化框架。所提出的FIP包含一对新颖的正则化项,通过利用费雪信息矩阵(FIM)的知识,帮助模型在整个后门移除过程中抑制后门效应并保留对干净数据分布的已有知识。此外,我们引入了FIP的一个高效变体,称为Fast FIP,它显著减少了可调参数的数量,并获得了近5倍的显著运行时间增益。大量实验表明,所提出的方法在广泛的后门防御基准上达到了最先进(SOTA)的性能:包括5个不同任务——图像识别、目标检测、视频动作识别、3D点云、语言生成;11个不同数据集,包括ImageNet、PASCAL VOC、UCF101;涵盖CNN和视觉Transformer的多种模型架构;14种不同的后门攻击,例如Dynamic、WaNet、LIRA、ISSBA等。

关键词

引用

@article{arxiv.2409.00863,
  title  = {Fisher Information guided Purification against Backdoor Attacks},
  author = {Nazmul Karim and Abdullah Al Arafat and Adnan Siraj Rakin and Zhishan Guo and Nazanin Rahnavard},
  journal= {arXiv preprint arXiv:2409.00863},
  year   = {2024}
}

备注

Accepted to ACM CCS 2024. arXiv admin note: text overlap with arXiv:2306.17441