中文

利用对抗样本攻击视觉语言接地:以神经图像描述为例

计算机视觉与模式识别 2018-05-23 v2

摘要

视觉语言接地在现代神经图像描述系统中被广泛研究,其通常采用由两大部分组成的编码器-解码器框架:用于图像特征提取的卷积神经网络(CNN)和用于语言描述生成的循环神经网络(RNN)。为研究机器视觉与感知中语言接地对对抗扰动的鲁棒性,我们提出 Show-and-Fool,一种用于神经图像描述中构造对抗样本的新算法。所提算法提供两种评估方法,用于检验神经图像描述系统是否会被误导输出某些随机选定的描述或关键词。我们的大量实验表明,该算法能成功构造具有视觉相似性的对抗样本,其目标为随机描述或关键词,且这些对抗样本可高度迁移至其他图像描述系统。因此,我们的方法为神经图像描述带来了新的鲁棒性启示,并为视觉语言接地提供了新颖见解。

关键词

引用

@article{arxiv.1712.02051,
  title  = {Attacking Visual Language Grounding with Adversarial Examples: A Case Study on Neural Image Captioning},
  author = {Hongge Chen and Huan Zhang and Pin-Yu Chen and Jinfeng Yi and Cho-Jui Hsieh},
  journal= {arXiv preprint arXiv:1712.02051},
  year   = {2018}
}

备注

Accepted by 56th Annual Meeting of the Association for Computational Linguistics (ACL 2018). Hongge Chen and Huan Zhang contribute equally to this work