中文

基于自适应对抗探针的通用后门攻击检测

计算机视觉与模式识别 2022-12-08 v3 密码学与安全

摘要

大量证据表明深度神经网络(DNNs)易受后门攻击,这推动了后门攻击检测的发展。多数检测方法旨在验证模型是否感染了假定类型的后门攻击,然而实践中攻击者很可能生成防御者未预见到的多样化后门攻击,这对当前检测策略构成挑战。本文关注这一更具挑战性的场景,并提出一种名为自适应对抗探针(Adaptive Adversarial Probe, A2P)的通用后门攻击检测方法。具体而言,我们认为通用后门攻击检测的挑战在于不同后门攻击在触发模式(即尺寸与透明度)上常表现出多样特征。因此,我们的A2P采用全局到局部的探针框架,以自适应区域/预算对图像进行对抗性探针,以适配不同尺寸/透明度的各类后门触发器。关于探针区域,我们提出注意力引导的区域生成策略,基于目标模型的注意力生成不同尺寸/位置的候选区域,因为触发区域常表现出更高的模型激活。考虑攻击预算,我们引入从盒式到稀疏的调度,迭代地增加从盒式约束到稀疏约束的扰动预算,从而更好地激活具有不同透明度的各类潜在后门。在多个数据集(CIFAR-10、GTSRB、Tiny-ImageNet)上的大量实验表明,我们的方法大幅优于最先进基线(+12%)。

关键词

引用

@article{arxiv.2209.05244,
  title  = {Universal Backdoor Attacks Detection via Adaptive Adversarial Probe},
  author = {Yuhang Wang and Huafeng Shi and Rui Min and Ruijia Wu and Siyuan Liang and Yichao Wu and Ding Liang and Aishan Liu},
  journal= {arXiv preprint arXiv:2209.05244},
  year   = {2022}
}

备注

8 pages, 8 figures