M-to-N 后门范式:一种面向深度学习模型的多触发与多目标攻击
密码学与安全
2024-07-02 v2
摘要
深度神经网络(DNNs)易受后门攻击,其中被植入后门的模型在干净输入下表现正常,但在包含触发器的输入上表现出攻击者指定的行为。以往大多数后门攻击主要关注全到一或全到全范式,允许攻击者操纵输入以攻击单一目标类。此外,这两种范式依赖单一触发器激活后门,若触发器被破坏则攻击失效。有鉴于此,我们提出一种新的 -to- 攻击范式,允许攻击者操纵任意输入以攻击 个目标类,且 个目标类中每个后门可由其 个触发器中的任意一个激活。我们的攻击从每个目标类选取 张干净图像作为触发器,并利用所提出的毒化图像生成框架将触发器不可见地注入干净图像。通过使用与干净训练图像同分布的触发器,目标 DNN 模型能在训练中对触发器泛化,从而提升我们对多目标类攻击的有效性。大量实验结果表明,我们的新后门攻击在攻击多个目标类方面高度有效,且对预处理操作与现有防御具有鲁棒性。
引用
@article{arxiv.2211.01875,
title = {M-to-N Backdoor Paradigm: A Multi-Trigger and Multi-Target Attack to Deep Learning Models},
author = {Linshan Hou and Zhongyun Hua and Yuhong Li and Yifeng Zheng and Leo Yu Zhang},
journal= {arXiv preprint arXiv:2211.01875},
year = {2024}
}
备注
14 pages; Accepted to IEEE Transactions on Circuits and Systems for Video Technology (2024)