中文

一图值千谎:视觉语言模型中跨提示的对抗可迁移性

计算机视觉与模式识别 2024-03-18 v1

摘要

不同于传统的特定任务视觉模型,最新的大型视觉语言模型 (Vision-Language Model, VLM) 仅需使用不同的文本指令(即提示)即可轻松适应不同的视觉任务。然而,传统特定任务视觉模型面临的一个众所周知的问题是,它们可能会被不可感知的对抗扰动所误导。此外,相同的对抗扰动能够欺骗不同的特定任务模型,这一现象进一步加剧了这种担忧。鉴于 VLM 依赖提示来适应不同任务,一个引人深思的问题随之而来:当给定一千个不同的提示时,单张对抗图像能否误导 VLM 的所有预测?这个问题本质上引入了关于对抗可迁移性的一个新视角:跨提示对抗可迁移性。在本工作中,我们提出了跨提示攻击 (Cross-Prompt Attack, CroPA)。该方法利用可学习提示来更新视觉对抗扰动,这些提示旨在抵消对抗图像的误导效应。通过这种方式,CroPA 显著提升了对抗样本在不同提示间的可迁移性。我们进行了大量实验,验证了 CroPA 在包括 Flamingo、BLIP-2 和 InstructBLIP 在内的主流 VLM 上及各种不同任务中强大的跨提示对抗可迁移性。我们的源代码可在 \url{https://github.com/Haochen-Luo/CroPA} 获取。

关键词

引用

@article{arxiv.2403.09766,
  title  = {An Image Is Worth 1000 Lies: Adversarial Transferability across Prompts on Vision-Language Models},
  author = {Haochen Luo and Jindong Gu and Fengyuan Liu and Philip Torr},
  journal= {arXiv preprint arXiv:2403.09766},
  year   = {2024}
}

备注

Accepted to ICLR 2024