中文

面向高效后门净化的增强型神经网络微调

计算机视觉与模式识别 2024-07-18 v2

摘要

近期研究揭示了深度神经网络(DNN)对各种后门攻击的脆弱性,攻击者可通过特定触发器或投毒机制 compromise DNN 的行为。当前最先进(SOTA)防御方法过于复杂,需要计算昂贵的对抗搜索模块来逆向工程触发器分布,或需要精细调谐的超参数选择模块。此外,这些方法在面对数据有限和强攻击等挑战场景时表现不佳。本文提出一种神经掩码微调(NFT)方法,旨在以最优方式重新组织神经元活动,以消除后门效应。利用简单的增强数据技术(如 MixUp),NFT 松弛了触发器合成过程,消除了对对抗搜索模块的需求。我们的研究进一步表明,在数据有限的情况下直接进行权重微调会导致后净化干净测试准确率差,主要由于过拟合问题。为克服这一问题,我们提出对神经掩码进行微调而非模型权重。此外,设计了一个掩码正则化器,以进一步减轻净化过程中的模型漂移。NFT 的独特特征使其在运行时和样本使用方面具有高度效率,仅凭每类可用单个样本即可消除后门。我们通过广泛的实验验证了 NFT 的有效性,涵盖图像分类、目标检测、视频动作识别、3D 点云和自然语言处理等任务。我们在 11 个基准数据集上(如 ImageNet、UCF101、Pascal VOC、ModelNet、OpenSubtitles2012 等)对 14 种不同攻击(LIRA、WaNet 等)进行了评估。

关键词

引用

@article{arxiv.2407.10052,
  title  = {Augmented Neural Fine-Tuning for Efficient Backdoor Purification},
  author = {Nazmul Karim and Abdullah Al Arafat and Umar Khalid and Zhishan Guo and Nazanin Rahnavard},
  journal= {arXiv preprint arXiv:2407.10052},
  year   = {2024}
}

备注

Accepted to ECCV 2024