中文

BadActs:基于激活空间的通用后门防御

密码学与安全 2024-05-21 v1 计算与语言

摘要

后门攻击正日益严重地威胁着深度神经网络(DNN)在开发阶段的安全性。作为响应,后门样本净化已成为一种有前景的防御机制,旨在在保留样本干净内容完整性的同时消除后门触发器。然而,现有方法主要关注词语空间,对抗特征空间触发器无效,且显著降低干净数据的性能。为此,我们引入一种在激活空间中净化后门样本的通用后门防御方法,通过将异常激活引导 toward 优化后的干净激活分布区间。我们方法的优势体现在两个方面:(1)在激活空间中操作,能够从表层信息(如词语)捕获到语法等高阶语义概念,从而抵御多样化触发器;(2)激活空间的细粒度连续性允许在移除触发器的同时更精确地保留干净内容。此外,我们提出了基于异常激活统计信息的检测模块,以实现干净准确率与防御性能之间的最佳平衡。

关键词

引用

@article{arxiv.2405.11227,
  title  = {BadActs: A Universal Backdoor Defense in the Activation Space},
  author = {Biao Yi and Sishuo Chen and Yiming Li and Tong Li and Baolei Zhang and Zheli Liu},
  journal= {arXiv preprint arXiv:2405.11227},
  year   = {2024}
}

备注

ACL2024 Findings