SATBA:一种基于空间注意力的不可见后门攻击
密码学与安全
2024-03-06 v3 计算机视觉与模式识别
摘要
后门攻击已成为一种针对 AI 安全的新兴且令人担忧的威胁。这些攻击涉及在包含隐藏触发模式的数据集上训练深度神经网络(DNN)。尽管被投毒的模型在良性样本上表现正常,但在包含触发模式的样本上会表现出异常行为。然而,大多数现有后门攻击存在两个显著缺陷:其触发模式可见且易被后门防御甚至人工检查检测到,并且其注入过程导致自然样本特征和触发模式的丢失,从而降低了攻击成功率和模型精度。在本文中,我们提出一种名为 SATBA 的新型后门攻击,利用空间注意力和基于 U-net 的模型克服了这些局限。攻击过程首先使用空间注意力提取有意义的数据特征并生成与干净图像相关的触发模式。然后,使用 U 形模型将这些触发模式嵌入原始数据而不引起明显的特征丢失。我们在三个标准数据集上的三个著名图像分类 DNN 上评估了我们的攻击。结果表明,SATBA 在保持对后门防御的鲁棒性的同时实现了高攻击成功率。此外,我们进行了广泛的图像相似性实验以强调我们攻击策略的隐蔽性。总体而言,SATBA 提出了一种有前景的后门攻击方法,解决了先前方法的不足,并展示了其在规避检测和维护高攻击成功率方面的有效性。
引用
@article{arxiv.2302.13056,
title = {SATBA: An Invisible Backdoor Attack Based On Spatial Attention},
author = {Huasong Zhou and Xiaowei Xu and Xiaodong Wang and Leon Bevan Bullock},
journal= {arXiv preprint arXiv:2302.13056},
year = {2024}
}
备注
9 pages, 9 figures