面向目标检测器的物理对抗样本
密码学与安全
2018-10-09 v2 计算机视觉与模式识别
机器学习
摘要
深度神经网络(DNNs)易受对抗样本——即恶意构造的使 DNN 做出错误预测的输入——的攻击。近期工作表明这些攻击可推广至物理域,在物理物体上制造在多种现实条件下愚弄图像分类器的扰动。此类攻击对用于安全关键信息物理系统中的深度学习模型构成风险。在本工作中,我们将物理攻击扩展至更具挑战性的目标检测模型,这是一类广泛用于检测并标记场景中多个物体的深度学习算法。在先前针对图像分类器的物理攻击基础上,我们创建了被目标检测模型忽略或误标的扰动物理物体。我们实现了一种消失攻击(Disappearance Attack),使 Stop 标志根据检测器“消失”——或通过贴对抗性 Stop 标志海报覆盖标志,或通过在标志上添加对抗性贴纸。在受控实验室环境录制的视频中,最先进的 YOLOv2 检测器在超过 85% 的视频帧中未能识别这些对抗性 Stop 标志。在户外实验中,YOLO 分别被海报与贴纸攻击在 72.5% 和 63.5% 的视频帧中愚弄。我们还使用另一种目标检测模型 Faster R-CNN 来证明对抗扰动的迁移性。所创建的海报扰动在受控实验室环境的 85.9% 视频帧中愚弄 Faster R-CNN,在户外环境的 40.2% 视频帧中愚弄。最后,我们给出了一种新的创造攻击(Creation Attack)的初步结果,其中无害物理贴纸愚弄模型检测出不存在的物体。
引用
@article{arxiv.1807.07769,
title = {Physical Adversarial Examples for Object Detectors},
author = {Kevin Eykholt and Ivan Evtimov and Earlence Fernandes and Bo Li and Amir Rahmati and Florian Tramer and Atul Prakash and Tadayoshi Kohno and Dawn Song},
journal= {arXiv preprint arXiv:1807.07769},
year = {2018}
}
备注
This paper is the extended version of the USENIX WOOT 2018 version