UMD:面向 X2X 后门攻击的无监督模型检测方法
机器学习
2023-11-17 v4 密码学与安全
计算机视觉与模式识别
摘要
后门(木马)攻击是深度神经网络的常见威胁,其中嵌入后门触发器的来自一个或多个源类的样本将被误分类到对抗性目标类。现有的用于检测分类器是否遭受后门攻击的方法大多针对具有单一对抗性目标(例如全到一攻击)的攻击而设计。据我们所知,在无监督条件下,现有方法均无法有效应对更通用的 X2X 攻击——其具有任意数量的源类,每个源类配对任意目标类。本文中,我们提出 UMD,第一种无监督模型检测(Unsupervised Model Detection)方法,通过对对抗性(源,目标)类对的联合推断有效检测 X2X 后门攻击。具体而言,我们首先定义一种新颖的可迁移性统计量,基于所提聚类方法度量并筛选出一组疑似后门类对。然后,基于我们提出的鲁棒无监督异常检测器,利用这些选中类对所逆向工程触发器的尺寸聚合进行联合评估以完成检测推断。我们在 CIFAR-10、GTSRB 和 Imagenette 数据集上进行了综合评估,表明我们的无监督 UMD 在检测准确率上分别超越 SOTA 检测器(即便有监督)17%、4% 和 8%,以应对多样的 X2X 攻击。我们还展示了 UMD 对若干强自适应攻击的强检测性能。
引用
@article{arxiv.2305.18651,
title = {UMD: Unsupervised Model Detection for X2X Backdoor Attacks},
author = {Zhen Xiang and Zidi Xiong and Bo Li},
journal= {arXiv preprint arXiv:2305.18651},
year = {2023}
}
备注
Proceedings of the 40th International Conference on Machine Learning