中文

基于带潜变量结构化输出学习的图像描述精确对抗攻击

计算机视觉与模式识别 2019-05-13 v1 人工智能

摘要

本文研究了基于 CNN+RNN 的图像描述系统在受到对抗噪声干扰时的鲁棒性。我们提出通过添加对抗噪声来误导图像描述系统,使其为受污染图像生成某些指定的部分描述,即便这些指定描述与图像内容完全无关。部分描述是指该描述中某些位置上的词是给定的,而其他位置上的词不受限制。这是首项研究针对指定部分描述的精确对抗攻击的工作。由于描述中词与词之间存在序列依赖关系,我们将生成针对指定部分描述的对抗噪声问题表述为一个带潜变量的结构化输出学习问题。随后采用广义期望最大化算法和带潜变量的结构 SVM 来优化该问题。所提出的方法对三种流行的基于 CNN+RNN 的图像描述模型产生了非常成功的攻击。此外,所提出的攻击方法被用于理解图像描述系统的内部机制,为进一步提升自动图像描述系统以接近人类描述水平提供了指导。

关键词

引用

@article{arxiv.1905.04016,
  title  = {Exact Adversarial Attack to Image Captioning via Structured Output Learning with Latent Variables},
  author = {Yan Xu and Baoyuan Wu and Fumin Shen and Yanbo Fan and Yong Zhang and Heng Tao Shen and Wei Liu},
  journal= {arXiv preprint arXiv:1905.04016},
  year   = {2019}
}

备注

Accepted to CVPR 2019. Yan Xu and Baoyuan Wu are co-first authors