通过对抗攻击实现图像的可控描述生成
计算机视觉与模式识别
2021-07-08 v1 机器学习
摘要
深度学习被发现易受对抗样本攻击。然而,其在图像描述生成中的对抗脆弱性尚待充分探索。我们研究视觉与语言模型的对抗样本,此类模型通常采用由两大组件构成的编码器-解码器框架:用于图像特征提取的卷积神经网络(即 CNN)和用于描述生成的循环神经网络(RNN)。具体而言,我们探究对输入后续循环网络的视觉编码器隐藏层的攻击。现有方法要么攻击视觉编码器的分类层,要么从语言模型反向传播梯度。相比之下,我们提出一种基于 GAN 的算法来构造神经图像描述生成的对抗样本,该算法模仿 CNN 的内部表示,使得输入图像的所得深度特征能够通过循环网络实现可控的错误描述生成。我们的贡献为理解带语言组件的视觉系统的对抗攻击提供了新见解。所提方法采用两种策略进行全面评估。第一种检验神经图像描述系统是否能被误导输出指定图像描述。第二种分析将关键词植入预测描述中的可能性。实验表明,我们的算法能基于 CNN 隐藏层构造有效的对抗图像以欺骗描述框架。此外,我们发现所提攻击具有高度可迁移性。我们的工作为神经图像描述生成带来了新的鲁棒性启示。
引用
@article{arxiv.2107.03050,
title = {Controlled Caption Generation for Images Through Adversarial Attacks},
author = {Nayyer Aafaq and Naveed Akhtar and Wei Liu and Mubarak Shah and Ajmal Mian},
journal= {arXiv preprint arXiv:2107.03050},
year = {2021}
}