对抗涂鸦:可解释且可手绘的攻击提供可描述的洞察
计算机视觉与模式识别
2024-09-12 v3
摘要
基于DNN的图像分类器易受对抗攻击。以往多数对抗攻击无明显模式,难以解释攻击结果并洞察分类器机制。因此,我们提出具有可解释形状的对抗涂鸦(Adversarial Doodles)。我们优化黑色贝塞尔曲线,将其叠加到输入图像上以欺骗分类器。通过引入随机仿射变换并正则化涂鸦区域,我们获得小尺寸攻击,即使人类手工复现也能导致误分类。对抗涂鸦提供了关于人类手绘涂鸦形状与分类器输出之间关系的可描述洞察,例如“当我们在直升机图像上添加三个小圆时,ResNet-50分类器会将其误分类为飞机”。
引用
@article{arxiv.2311.15994,
title = {Adversarial Doodles: Interpretable and Human-drawable Attacks Provide Describable Insights},
author = {Ryoya Nara and Yusuke Matsui},
journal= {arXiv preprint arXiv:2311.15994},
year = {2024}
}