利用共享对抗训练防御通用扰动
计算机视觉与模式识别
2019-08-14 v2 密码学与安全
机器学习
机器学习
摘要
深度神经网络等分类器已被证明在具有高维输入空间的问题上易受对抗扰动的攻击。虽然对抗训练提升了图像分类器对此类对抗扰动的鲁棒性,但仍有不可忽略比例输入上的扰动能使其失效。在本文中,我们表明对抗训练在防止通用扰动(即同一扰动需在多个输入上欺骗分类器)方面更为有效。此外,我们研究了针对通用扰动的鲁棒性与未扰动数据上性能之间的权衡,并提出了一种更优雅地处理该权衡的对抗训练扩展方法。我们给出了图像分类与语义分割的结果,以展示经对抗训练加固的模型所被骗的通用扰动变得清晰可感知,并呈现出目标场景的模式。
引用
@article{arxiv.1812.03705,
title = {Defending Against Universal Perturbations With Shared Adversarial Training},
author = {Chaithanya Kumar Mummadi and Thomas Brox and Jan Hendrik Metzen},
journal= {arXiv preprint arXiv:1812.03705},
year = {2019}
}
备注
ICCV 2019, 8 main pages, 9 appendix pages, 16 figures, 2 tables