中文

面向后门防御的模型对比学习

机器学习 2022-05-18 v2

摘要

由于人工智能(AI)技术的普及,我们正目睹越来越多旨在恶意威胁深度神经网络(DNN)并导致误分类的后门注入攻击。尽管存在多种可有效擦除 DNN 中后门的防御方法,它们却深受高攻击成功率(ASR)与良性准确率(BA)不可忽略下降的困扰。受“后门 DNN 倾向于在中毒数据特征空间中形成新簇”这一观察启发,本文提出一种基于模型对比学习(MCL)的名为 MCLDef 的新型两阶段后门防御方法。第一阶段,我们的方法基于触发器合成执行触发器反演,所得触发器可用于生成中毒数据。第二阶段,在 MCL 与我们定义的正、负样本对指导下,MCLDef 通过将中毒数据的特征表示拉向其干净数据对应表示来净化后门模型。由于中毒数据簇收缩,端到端监督学习形成的后门被消除。综合实验结果表明,仅用 5% 干净数据,MCLDef 在 ASR 上较最先进防御方法最高降低 95.79%,且在多数情况下 BA 退化可控制在小于 2%。我们的代码见 https://github.com/WeCanShow/MCL。

关键词

引用

@article{arxiv.2205.04411,
  title  = {Model-Contrastive Learning for Backdoor Defense},
  author = {Zhihao Yue and Jun Xia and Zhiwei Ling and Ming Hu and Ting Wang and Xian Wei and Mingsong Chen},
  journal= {arXiv preprint arXiv:2205.04411},
  year   = {2022}
}