中文

针对由锐度感知最小化增强的后门攻击的可靠中毒样本检测

计算机视觉与模式识别 2024-11-19 v1

摘要

后门攻击已被认为是深度神经网络(DNN)的严重安全威胁。旨在从不可信训练数据集中过滤掉中毒样本的中毒样本检测(PSD),在防御基于数据投毒的后门攻击方面展现出了极具前景的性能。然而,我们观察到,许多先进方法的检测性能在面对弱后门攻击(如低投毒比例或弱触发强度)时可能并不稳定。为了进一步验证这一观察,我们对各种后门攻击和中毒样本检测进行了统计调查,表明后门效应与检测性能之间存在正相关关系。这启发我们通过增强后门效应来提升检测性能。由于我们无法通过直接操纵投毒比例或触发强度来实现这一目标,我们提出使用锐度感知最小化(SAM)算法而非普通训练算法来训练模型。我们还从经验和理论上分析了 SAM 训练如何增强后门效应。然后,该 SAM 训练的模型可以与任何现成的 PSD 方法无缝集成,这些方法从训练好的模型中提取判别特征进行检测,称为 SAM 增强的 PSD。在几个基准数据集上的大量实验表明,所提出的方法针对弱和强后门攻击均具有可靠的检测性能,相较于传统的 PSD 方法(即未使用 SAM 增强的方法),在各种攻击下均有显著提升(平均 TPR 提升 +34.38%+34.38\%)。总体而言,这项工作为 PSD 提供了新见解,并提出了一种可以补充现有检测方法的新颖方法,这可能激发该领域更深入的探索。

关键词

引用

@article{arxiv.2411.11525,
  title  = {Reliable Poisoned Sample Detection against Backdoor Attacks Enhanced by Sharpness Aware Minimization},
  author = {Mingda Zhang and Mingli Zhu and Zihao Zhu and Baoyuan Wu},
  journal= {arXiv preprint arXiv:2411.11525},
  year   = {2024}
}