中文

FLARE:通用数据净化防御背门攻击

密码学与安全 2025-06-24 v3 人工智能 计算机视觉与模式识别 机器学习

摘要

深度神经网络(DNN)易受到背门攻击,攻击者会通过投毒数据集来植入隐藏背门,以实现对模型预测的恶意操控。数据净化作为一种主动防御,通过删除恶意训练样本来防止背门在源头上注入。我们首先揭示,当前先进的净化方法依赖一种潜在假设,即背门攻击中触发器与目标标签之间的背门连接比良性特征更易学习。我们证明,这一假设在特别是全到全(all-to-all, A2A)和非定向(untargeted, UT)攻击中并不总是成立。因此,分析输入输出空间或最终隐藏层空间中被投毒样本与良性样本分离性的净化方法效果较差。我们观察到,这种可分离性并不局限于单一层,而是跨越不同隐藏层。基于这一认识,我们提出了FLARE,一种通用净化方法,以应对各种背门攻击。FLARE聚合来自所有隐藏层的异常激活来构建表示用于聚类。为增强分离性,FLARE开发了自适应子空间选择算法,以隔离分割整个数据集的最佳空间。FLARE评估每个聚类的稳定性,并识别稳定性更高的聚类作为被投毒的聚类。在基准数据集上进行的广泛评估表明,FLARE对22种代表性背门攻击(包括全到一(all-to-one, A2O)、全到全(all-to-all, A2A)和非定向(untargeted, UT)攻击)均有效,并且对适应性攻击具有鲁棒性。代码已提供给\href{https://github.com/THUYimingLi/BackdoorBox}{BackdoorBox}和\href{https://github.com/vtu81/backdoor-toolbox}{backdoor-toolbox}。

关键词

引用

@article{arxiv.2411.19479,
  title  = {FLARE: Toward Universal Dataset Purification against Backdoor Attacks},
  author = {Linshan Hou and Wei Luo and Zhongyun Hua and Songhua Chen and Leo Yu Zhang and Yiming Li},
  journal= {arXiv preprint arXiv:2411.19479},
  year   = {2025}
}

备注

15 pages, This paper is accepted and will appear in TIFS (CCF-A)