当心!简单水平类后门可轻易规避防御
摘要
当前所有针对深度学习(DL)模型的后门攻击都属于垂直类后门(VCB)——即依赖于类别。在VCB攻击中,来自某一类的任何样本在存在秘密触发器时都会激活植入的后门。现有防御策略绝大多数侧重于应对VCB攻击,尤其是那些源类无关的类型。这种狭隘的关注忽视了其他更简单但更通用的后门类型的潜在威胁,导致错误的安全性暗示。本研究引入了一种新颖、简单且通用的后门攻击类型,称为水平类后门(HCB),它轻易打破了VCB的类别依赖特征,为社区带来了新的视角。HCB现在在触发器与无害特征共同出现时激活,而与类别无关。例如,面部识别模型会将佩戴太阳镜并带有微笑无害特征的人误分类为目标人物(如管理员),而不论其原本是哪个人。关键在于,这些无害特征在各类之间水平共享,但每个类中仅由部分样本展现。在包括MNIST、面部识别、交通标志识别、目标检测和医学诊断在内的多种任务上的广泛攻击实验证实了HCB的高效性和有效性。我们严格评估了HCB对一系列十一种代表性对策的规避能力,包括Fine-Pruning(RAID 18')、STRIP(ACSAC 19')、Neural Cleanse(Oakland 19')、ABS(CCS 19')、Februus(ACSAC 20')、NAD(ICLR 21')、MNTD(Oakland 21')、SCAn(USENIX SEC 21')、MOTH(Oakland 22')、Beatrix(NDSS 23')和MM-BD(Oakland 24')。即使采用简单触发器(如小而静态的白色方块补丁),这些对策均未能证明鲁棒性。
引用
@article{arxiv.2310.00542,
title = {Watch Out! Simple Horizontal Class Backdoor Can Trivially Evade Defense},
author = {Hua Ma and Shang Wang and Yansong Gao and Zhi Zhang and Huming Qiu and Minhui Xue and Alsharif Abuadbba and Anmin Fu and Surya Nepal and Derek Abbott},
journal= {arXiv preprint arXiv:2310.00542},
year = {2024}
}
备注
To Appear in the 31st ACM Conference on Computer and Communications Security, October 14-18, 2024