基于去噪自编码器的深度神经网络不可感知样本专属后门
密码学与安全
2024-12-24 v2
摘要
后门攻击对深度神经网络构成了新的安全威胁。现有后门通常依赖可见的通用触发器使被植入后门的模型发生故障,这类触发器不仅在视觉上常令人生疑,而且可被主流防御手段检测。我们提出了一种不可感知的样本专属后门,其触发器随样本变化且不可见。我们的触发器生成通过去噪自编码器自动完成,该自编码器以精细但普遍存在的特征(即每幅图像的边缘模式)为输入。我们在 ImageNet 和 MS-Celeb-1M 上广泛实验了我们的后门攻击,结果表明其具有稳定且接近 100%(即 99.8%)的攻击成功率,且对被感染模型在干净数据上的准确率影响可忽略。基于去噪自编码器的触发器生成器可在任务间复用或迁移(例如从 ImageNet 到 MS-Celeb-1M),同时触发器具有高度排他性(即为某一样本生成的触发器不适用于另一样本)。此外,我们提出的被植入后门的模型对 Neural Cleanse、STRIP、SentiNet 和 Fine-Pruning 等主流后门防御具有高度规避性。
引用
@article{arxiv.2302.04457,
title = {Imperceptible Sample-Specific Backdoor to DNN with Denoising Autoencoder},
author = {Xiangqi Wang and Mingfu Xue and Kewei Chen and Jing Xu and Wenmao Liu and Leo Yu Zhang and Yushu Zhang},
journal= {arXiv preprint arXiv:2302.04457},
year = {2024}
}