防御针对图像分类的物理可实现攻击
机器学习
2020-02-18 v2 人工智能
计算机视觉与模式识别
图像与视频处理
机器学习
摘要
我们研究防御深度神经网络图像分类方法免受物理可实现攻击的问题。首先,我们证明两种最具可扩展性和有效性的鲁棒模型学习方法——使用 PGD 攻击的对抗训练和随机平滑——对三种最受关注的物理攻击表现出非常有限的有效性。其次,我们提出一种新的抽象对抗模型——矩形遮挡攻击,其中攻击者在图像中放置一个小的、经对抗性设计的矩形,并开发了两种高效计算由此产生的对抗样本的方法。最后,我们证明使用我们的新攻击进行对抗训练所得到的图像分类模型,对我们研究的物理可实现攻击表现出高鲁棒性,提供了首个针对此类攻击的有效通用防御。
引用
@article{arxiv.1909.09552,
title = {Defending Against Physically Realizable Attacks on Image Classification},
author = {Tong Wu and Liang Tong and Yevgeniy Vorobeychik},
journal= {arXiv preprint arXiv:1909.09552},
year = {2020}
}
备注
camera-ready