MM-BD:基于最大间隔统计量对任意后门图案类型后门攻击的训练后检测
机器学习
2023-08-08 v2 密码学与安全
摘要
后门攻击是针对深度神经网络分类器的一类重要对抗威胁,当嵌入后门图案时,来自一个或多个源类的测试样本将被(误)分类至攻击者的目标类。本文关注文献中常见的训练后后门防御场景,即防御者旨在无需访问训练集的情况下检测已训练分类器是否遭受后门攻击。许多训练后检测器被设计用于检测使用一种或少数几种特定后门嵌入函数(例如补丁替换或加性攻击)的攻击。当攻击者使用的后门嵌入函数(防御者未知)不同于防御者所假设的后门嵌入函数时,这些检测器可能失效。相反,我们提出一种训练后防御方法,可检测具有任意类型后门嵌入的后门攻击,且不对后门嵌入类型作任何假设。我们的检测器利用后门攻击对分类器在 softmax 层之前输出景观的影响,该影响独立于后门嵌入机制。对每一类,估计一个最大间隔统计量。随后通过对这些统计量应用无监督异常检测器来执行检测推断。因此,我们的检测器不需要任何合法干净样本,并能高效检测具有任意数量源类的后门攻击。相较于若干 SOTA 方法的这些优势在四个数据集、三种不同类型后门图案以及多种攻击配置下得到验证。最后,我们提出一种新颖的通用方法,用于在检测到后门后进行缓解。该缓解方法在首届 IEEE 木马移除竞赛中获得亚军。代码已在线公开。
引用
@article{arxiv.2205.06900,
title = {MM-BD: Post-Training Detection of Backdoor Attacks with Arbitrary Backdoor Pattern Types Using a Maximum Margin Statistic},
author = {Hang Wang and Zhen Xiang and David J. Miller and George Kesidis},
journal= {arXiv preprint arXiv:2205.06900},
year = {2023}
}