中文

我看见死人:面向图像到文本模型的灰盒对抗攻击

计算机视觉与模式识别 2023-07-20 v3 神经与进化计算

摘要

现代图像到文本系统通常采用编码器-解码器框架,包含两个主要组件:负责提取图像特征的图像编码器,以及用于生成描述的基于 transformer 的解码器。受神经网络对对抗扰动的鲁棒性分析启发,我们提出一种新颖的灰盒算法,用于在图像到文本模型中生成对抗样本。与具有有限类标签集合的图像分类任务不同,在图像到文本任务中寻找视觉相似的对抗样本更具挑战性,因为描述系统允许几乎无限的可能描述空间。本文提出一种针对图像到文本的无目标与有目标灰盒对抗攻击。我们将发现对抗扰动的过程表述为一个仅使用图像编码器组件的优化问题,意味着所提攻击与语言模型无关。通过在 Hugging Face 中最常用的图像到文本模型 ViT-GPT2 及 Flickr30k 数据集上的实验,我们证明了所提攻击能成功生成视觉相似的对抗样本,且无论无目标还是有目标描述皆然。值得注意的是,我们的攻击以灰盒方式运作,无需关于解码器模块的任何知识。我们还表明我们的攻击能欺骗流行的开源平台 Hugging Face。

关键词

引用

@article{arxiv.2306.07591,
  title  = {I See Dead People: Gray-Box Adversarial Attack on Image-To-Text Models},
  author = {Raz Lapid and Moshe Sipper},
  journal= {arXiv preprint arXiv:2306.07591},
  year   = {2023}
}