物理世界中针对深度学习系统的后门攻击
计算机视觉与模式识别
2021-09-08 v4 密码学与安全
机器学习
摘要
后门攻击将隐藏的恶意行为嵌入深度学习模型,仅在包含特定触发器的模型输入上激活并导致误分类。然而,现有的后门攻击与防御工作大多聚焦于使用数字生成图案作为触发器的数字攻击。一个关键问题仍未得到解答:使用物理对象作为触发器的后门攻击能否成功,从而使其成为现实世界中深度学习系统的可信威胁?我们开展了一项详细的实证研究,针对人脸识别这一关键深度学习任务探索该问题。使用七种物理对象作为触发器,我们收集了十名志愿者的 3205 张图像的自定义数据集,并用它研究在各种现实条件下物理后门攻击的可行性。我们的研究揭示了两个关键发现。首先,如果经过精心配置以克服物理对象带来的约束,物理后门攻击可以高度成功。特别地,成功触发器的放置很大程度上受目标模型对关键面部特征的依赖所约束。其次,当今四种最先进的(数字)后门防御对物理后门无效,因为物理对象的使用打破了用于构建这些防御的核心假设。我们的研究证实(物理)后门攻击并非假想现象,而是对关键分类任务构成严重的现实威胁。我们需要针对物理世界中的后门攻击提出新的、更鲁棒的防御。
引用
@article{arxiv.2006.14580,
title = {Backdoor Attacks Against Deep Learning Systems in the Physical World},
author = {Emily Wenger and Josephine Passananti and Arjun Bhagoji and Yuanshun Yao and Haitao Zheng and Ben Y. Zhao},
journal= {arXiv preprint arXiv:2006.14580},
year = {2021}
}
备注
Accepted to the 2021 Conference on Computer Vision and Pattern Recognition (CVPR 2021); 14 pages