中文

关于大型视觉-语言模型对抗鲁棒性的评估

计算机视觉与模式识别 2023-10-31 v2 计算与语言 密码学与安全 机器学习 多媒体

摘要

诸如 GPT-4 之类的大型视觉-语言模型(VLMs)在响应生成方面取得了前所未有的性能,尤其是在视觉输入下,相比 ChatGPT 等大型语言模型能够实现更具创造性和适应性的交互。然而,多模态生成加剧了安全担忧,因为攻击者可能通过微妙地操纵最脆弱的模态(例如视觉)来成功规避整个系统。为此,我们提出在最现实且高风险的设定下评估开源大型 VLMs 的鲁棒性,其中攻击者仅具有黑盒系统访问权限,并试图欺骗模型返回目标响应。具体而言,我们首先针对 CLIP 和 BLIP 等预训练模型制作目标对抗样本,然后将这些对抗样本迁移到其他 VLMs,如 MiniGPT-4、LLaVA、UniDiffuser、BLIP-2 和 Img2Prompt。此外,我们观察到对这些 VLMs 的黑盒查询能够进一步提升目标规避的有效性,从而以惊人的高成功率生成目标响应。我们的发现为大型 VLMs 的对抗脆弱性提供了定量理解,并呼吁在实践部署前对其潜在安全缺陷进行更彻底的审查。代码见 https://github.com/yunqing-me/AttackVLM。

关键词

引用

@article{arxiv.2305.16934,
  title  = {On Evaluating Adversarial Robustness of Large Vision-Language Models},
  author = {Yunqing Zhao and Tianyu Pang and Chao Du and Xiao Yang and Chongxuan Li and Ngai-Man Cheung and Min Lin},
  journal= {arXiv preprint arXiv:2305.16934},
  year   = {2023}
}

备注

NeurIPS 2023