WaNet——基于不可感知形变的后门攻击
密码学与安全
2021-03-05 v4 计算机视觉与模式识别
摘要
随着深度学习的蓬勃发展以及使用预训练网络的广泛实践,后门攻击已成为近年来引起诸多研究关注的安全威胁。第三方模型可在训练中被投毒,使其在正常情况下表现良好,但在触发模式出现时表现出恶意行为。然而,现有的后门攻击均构建于噪声扰动触发器之上,使其易被人类察觉。本文中,我们转而提出使用基于形变的触发器。所提出的后门在人类检查测试中大幅优于先前方法,证明了其隐蔽性。为使此类模型不被机器防御者检测,我们提出了一种称为“噪声模式”的新型训练模式。训练后的网络在标准分类数据集(包括MNIST、CIFAR-10、GTSRB和CelebA)上成功发起攻击并绕过最先进的防御方法。行为分析表明,我们的后门对网络检查是透明的,进一步证明了这一新型攻击机制的有效性。
引用
@article{arxiv.2102.10369,
title = {WaNet -- Imperceptible Warping-based Backdoor Attack},
author = {Anh Nguyen and Anh Tran},
journal= {arXiv preprint arXiv:2102.10369},
year = {2021}
}
备注
Accepted to ICLR 2021