PatchBackdoor:无需修改模型的后门攻击深度神经网络方法
机器学习
2023-08-24 v1 密码学与安全
计算机视觉与模式识别
摘要
后门攻击是安全关键场景中深度学习系统的重大威胁,旨在攻击者可控条件下触发神经网络模型的错误行为。然而,大多数后门攻击必须通过用毒化数据训练和/或直接编辑模型来修改神经网络模型,这导致了一个常见但错误的观念,即适当保护模型便可轻易避免后门攻击。本文中,我们展示后门攻击可在无任何模型修改的情况下实现。我们提出在相机前放置一个精心设计的补丁(即后门补丁),其与输入图像一同送入模型,而非将后门逻辑注入训练数据或模型中。该补丁可被训练为在大多数时间表现正常,而当输入图像包含攻击者可控触发物体时产生错误预测。我们的主要技术包括生成后门补丁的有效训练方法,以及增强补丁在实际部署中可行性的数字-物理变换建模方法。大量实验表明,PatchBackdoor 可应用于常见深度学习模型(VGG、MobileNet、ResNet),在分类任务上攻击成功率达 93% 至 99%。此外,我们在真实场景中实现 PatchBackdoor,表明该攻击仍具威胁。
引用
@article{arxiv.2308.11822,
title = {PatchBackdoor: Backdoor Attack against Deep Neural Networks without Model Modification},
author = {Yizhen Yuan and Rui Kong and Shenghao Xie and Yuanchun Li and Yunxin Liu},
journal= {arXiv preprint arXiv:2308.11822},
year = {2023}
}
备注
accepted by ACM MM 2023